diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1600/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1600/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1600/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1600/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1600/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1600/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1600/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1600/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1600/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1600/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1600/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..f7db7dd5f948a8b6d1eab0ece909a08e67e8c325
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1600/trainer_state.json
@@ -0,0 +1,1714 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 3.9813200498132004,
+ "eval_steps": 20,
+ "global_step": 1600,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.5786448366122394e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1620/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1620/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1620/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1620/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1620/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1620/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1620/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1620/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1620/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1620/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1620/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1620/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1620/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1620/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..149362f44983acc7882d97c08e8f3554b8e5abc9
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1620/trainer_state.json
@@ -0,0 +1,1735 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 4.029887920298879,
+ "eval_steps": 20,
+ "global_step": 1620,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.5984833993178317e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1640/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1640/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1640/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1640/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1640/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1640/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1640/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1640/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1640/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1640/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1640/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1640/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1640/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1640/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..5e236c52a75233c492f7d95acd57947fcf044a25
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1640/trainer_state.json
@@ -0,0 +1,1756 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 4.0797011207970115,
+ "eval_steps": 20,
+ "global_step": 1640,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.6179941205127987e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1660/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1660/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1660/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1660/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1660/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1660/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1660/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1660/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1660/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1660/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1660/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1660/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1660/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1660/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..c4e84d63e694e0b720cb2cd609f97172c27d275c
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1660/trainer_state.json
@@ -0,0 +1,1777 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 4.129514321295143,
+ "eval_steps": 20,
+ "global_step": 1660,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.6397263550241178e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1680/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1680/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1680/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1680/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1680/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1680/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1680/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1680/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1680/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1680/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1680/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1680/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1680/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1680/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..54f9bbfc7d25bf6d0789e503abaac37fe2f8aa68
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1680/trainer_state.json
@@ -0,0 +1,1798 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 4.179327521793275,
+ "eval_steps": 20,
+ "global_step": 1680,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.659570078821253e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1700/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1700/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1700/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1700/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1700/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1700/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1700/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1700/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1700/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1700/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1700/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1700/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1700/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1700/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..d7dbace534c62b8a00badfba241659e50453ac48
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1700/trainer_state.json
@@ -0,0 +1,1819 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 4.229140722291407,
+ "eval_steps": 20,
+ "global_step": 1700,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.67823079067861e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1720/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1720/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1720/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1720/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1720/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1720/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1720/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1720/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1720/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1720/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1720/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1720/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1720/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1720/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..89209a4e4bb1b3af747852d0af90c42017a0c0b1
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1720/trainer_state.json
@@ -0,0 +1,1840 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 4.2789539227895395,
+ "eval_steps": 20,
+ "global_step": 1720,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.6969022735096218e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1740/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1740/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1740/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1740/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1740/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1740/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1740/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1740/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1740/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1740/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1740/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1740/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1740/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1740/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..138eadc8ab2edc75f372381e1e7dd7d6fa57de24
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1740/trainer_state.json
@@ -0,0 +1,1861 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 4.328767123287671,
+ "eval_steps": 20,
+ "global_step": 1740,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.7173159613293363e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1760/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1760/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1760/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1760/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1760/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1760/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1760/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1760/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1760/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1760/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1760/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1760/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1760/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1760/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..089dcdd423fc2d6e3611a8401df43ae0376e0abe
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1760/trainer_state.json
@@ -0,0 +1,1882 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 4.378580323785803,
+ "eval_steps": 20,
+ "global_step": 1760,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.7368688688377856e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1780/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1780/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1780/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1780/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1780/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1780/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1780/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1780/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1780/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1780/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1780/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1780/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1780/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1780/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..c7dc2bcbe5d7012d4ce8f1ee7e0f5cc926cb5961
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1780/trainer_state.json
@@ -0,0 +1,1903 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 4.428393524283935,
+ "eval_steps": 20,
+ "global_step": 1780,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.756396644074373e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-180/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-180/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-180/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-180/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-180/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-180/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-180/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-180/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-180/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-180/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-180/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-180/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-180/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-180/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..b271c969248dc29a2195ac905bfc021c45986078
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-180/trainer_state.json
@@ -0,0 +1,223 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 0.44831880448318806,
+ "eval_steps": 20,
+ "global_step": 180,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.7813036230705152e+16,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1800/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1800/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1800/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1800/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1800/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1800/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1800/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1800/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1800/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1800/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1800/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1800/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1800/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1800/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..2ccf8815bb7ae4ed624a3fda91d1c9ad156a7d65
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1800/trainer_state.json
@@ -0,0 +1,1924 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 4.478206724782067,
+ "eval_steps": 20,
+ "global_step": 1800,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 1.7752727754048307e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1820/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1820/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1820/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1820/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1820/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1820/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1820/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1820/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-1820/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2200/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2200/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..56f9085c7867935c820718beb22f8a2683c332e8
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2200/trainer_state.json
@@ -0,0 +1,2344 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 5.473225404732254,
+ "eval_steps": 20,
+ "global_step": 2200,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ },
+ {
+ "entropy": 0.3193941755220294,
+ "epoch": 4.5280199252802,
+ "grad_norm": 0.8281906843185425,
+ "learning_rate": 0.0001509111761786888,
+ "loss": 0.23936262130737304,
+ "mean_token_accuracy": 0.9201708927750587,
+ "num_tokens": 4244423.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.5280199252802,
+ "eval_entropy": 0.38704028864239537,
+ "eval_loss": 0.6006569266319275,
+ "eval_mean_token_accuracy": 0.8502406720505205,
+ "eval_num_tokens": 4244423.0,
+ "eval_runtime": 86.8059,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1820
+ },
+ {
+ "entropy": 0.3164879363030195,
+ "epoch": 4.577833125778331,
+ "grad_norm": 0.7892968654632568,
+ "learning_rate": 0.00014905346557909867,
+ "loss": 0.24541733264923096,
+ "mean_token_accuracy": 0.9175932116806507,
+ "num_tokens": 4289773.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.577833125778331,
+ "eval_entropy": 0.38861122120951497,
+ "eval_loss": 0.6115967631340027,
+ "eval_mean_token_accuracy": 0.849471275196519,
+ "eval_num_tokens": 4289773.0,
+ "eval_runtime": 86.2946,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1840
+ },
+ {
+ "entropy": 0.3051785985007882,
+ "epoch": 4.627646326276463,
+ "grad_norm": 0.8109654188156128,
+ "learning_rate": 0.0001471849238862319,
+ "loss": 0.23433220386505127,
+ "mean_token_accuracy": 0.9206570319831371,
+ "num_tokens": 4336894.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.627646326276463,
+ "eval_entropy": 0.37162452295076015,
+ "eval_loss": 0.6184061765670776,
+ "eval_mean_token_accuracy": 0.8501173268223918,
+ "eval_num_tokens": 4336894.0,
+ "eval_runtime": 86.6865,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1860
+ },
+ {
+ "entropy": 0.3168198253959417,
+ "epoch": 4.677459526774595,
+ "grad_norm": 0.9512342214584351,
+ "learning_rate": 0.0001453061146267775,
+ "loss": 0.23832404613494873,
+ "mean_token_accuracy": 0.9197044663131237,
+ "num_tokens": 4382947.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.677459526774595,
+ "eval_entropy": 0.3845940856912801,
+ "eval_loss": 0.606762707233429,
+ "eval_mean_token_accuracy": 0.8504838194957999,
+ "eval_num_tokens": 4382947.0,
+ "eval_runtime": 86.5175,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 1880
+ },
+ {
+ "entropy": 0.30791807882487776,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 0.8123113512992859,
+ "learning_rate": 0.00014341760442398248,
+ "loss": 0.2395785331726074,
+ "mean_token_accuracy": 0.918928150832653,
+ "num_tokens": 4433050.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.7272727272727275,
+ "eval_entropy": 0.39762327222283494,
+ "eval_loss": 0.5994202494621277,
+ "eval_mean_token_accuracy": 0.8509274201337681,
+ "eval_num_tokens": 4433050.0,
+ "eval_runtime": 86.2873,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.993,
+ "step": 1900
+ },
+ {
+ "entropy": 0.3021434534341097,
+ "epoch": 4.777085927770859,
+ "grad_norm": 0.731787383556366,
+ "learning_rate": 0.000141519962826766,
+ "loss": 0.23494718074798585,
+ "mean_token_accuracy": 0.9201403826475143,
+ "num_tokens": 4483598.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.777085927770859,
+ "eval_entropy": 0.3827026732439219,
+ "eval_loss": 0.5995895862579346,
+ "eval_mean_token_accuracy": 0.851468373523202,
+ "eval_num_tokens": 4483598.0,
+ "eval_runtime": 86.3006,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 1920
+ },
+ {
+ "entropy": 0.31626159623265265,
+ "epoch": 4.826899128268991,
+ "grad_norm": 0.8848487138748169,
+ "learning_rate": 0.00013961376213795132,
+ "loss": 0.2439030647277832,
+ "mean_token_accuracy": 0.9196575872600079,
+ "num_tokens": 4529201.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.826899128268991,
+ "eval_entropy": 0.388698436839636,
+ "eval_loss": 0.6000174283981323,
+ "eval_mean_token_accuracy": 0.8518068187458571,
+ "eval_num_tokens": 4529201.0,
+ "eval_runtime": 86.8979,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.979,
+ "step": 1940
+ },
+ {
+ "entropy": 0.30520407035946845,
+ "epoch": 4.876712328767123,
+ "grad_norm": 0.8532460927963257,
+ "learning_rate": 0.00013769957724166695,
+ "loss": 0.23458616733551024,
+ "mean_token_accuracy": 0.9221912942826748,
+ "num_tokens": 4578167.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.876712328767123,
+ "eval_entropy": 0.38777847102908203,
+ "eval_loss": 0.6004981398582458,
+ "eval_mean_token_accuracy": 0.8516481768253238,
+ "eval_num_tokens": 4578167.0,
+ "eval_runtime": 87.0777,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.975,
+ "step": 1960
+ },
+ {
+ "entropy": 0.3226448342204094,
+ "epoch": 4.926525529265255,
+ "grad_norm": 0.6945561766624451,
+ "learning_rate": 0.0001357779854299694,
+ "loss": 0.24048397541046143,
+ "mean_token_accuracy": 0.9195300146937371,
+ "num_tokens": 4622316.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.926525529265255,
+ "eval_entropy": 0.38581624263247777,
+ "eval_loss": 0.6029234528541565,
+ "eval_mean_token_accuracy": 0.8514213260523108,
+ "eval_num_tokens": 4622316.0,
+ "eval_runtime": 85.8729,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 1980
+ },
+ {
+ "entropy": 0.3051655298098922,
+ "epoch": 4.976338729763388,
+ "grad_norm": 0.7976452708244324,
+ "learning_rate": 0.00013384956622874001,
+ "loss": 0.23584742546081544,
+ "mean_token_accuracy": 0.9216851457953453,
+ "num_tokens": 4670746.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.976338729763388,
+ "eval_entropy": 0.37913159246361533,
+ "eval_loss": 0.6057604551315308,
+ "eval_mean_token_accuracy": 0.8525801203971686,
+ "eval_num_tokens": 4670746.0,
+ "eval_runtime": 86.1145,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2000
+ },
+ {
+ "entropy": 0.27438195240803254,
+ "epoch": 5.024906600249066,
+ "grad_norm": 0.6729586124420166,
+ "learning_rate": 0.0001319149012229075,
+ "loss": 0.19775952100753785,
+ "mean_token_accuracy": 0.9339428559327737,
+ "num_tokens": 4716176.0,
+ "step": 2020
+ },
+ {
+ "epoch": 5.024906600249066,
+ "eval_entropy": 0.3448961910813354,
+ "eval_loss": 0.6750120520591736,
+ "eval_mean_token_accuracy": 0.8487970232963562,
+ "eval_num_tokens": 4716176.0,
+ "eval_runtime": 86.1169,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2020
+ },
+ {
+ "entropy": 0.21423916313797237,
+ "epoch": 5.074719800747198,
+ "grad_norm": 0.6934391856193542,
+ "learning_rate": 0.00012997457388105022,
+ "loss": 0.1439570426940918,
+ "mean_token_accuracy": 0.9528236843645572,
+ "num_tokens": 4763269.0,
+ "step": 2040
+ },
+ {
+ "epoch": 5.074719800747198,
+ "eval_entropy": 0.3570949243771475,
+ "eval_loss": 0.6465504169464111,
+ "eval_mean_token_accuracy": 0.8490785547467166,
+ "eval_num_tokens": 4763269.0,
+ "eval_runtime": 85.9574,
+ "eval_samples_per_second": 15.996,
+ "eval_steps_per_second": 2.001,
+ "step": 2040
+ },
+ {
+ "entropy": 0.20838565267622472,
+ "epoch": 5.12453300124533,
+ "grad_norm": 0.7286986112594604,
+ "learning_rate": 0.00012802916937942972,
+ "loss": 0.14467307329177856,
+ "mean_token_accuracy": 0.950994835793972,
+ "num_tokens": 4809047.0,
+ "step": 2060
+ },
+ {
+ "epoch": 5.12453300124533,
+ "eval_entropy": 0.3452463157821533,
+ "eval_loss": 0.6705958843231201,
+ "eval_mean_token_accuracy": 0.8490352796953778,
+ "eval_num_tokens": 4809047.0,
+ "eval_runtime": 86.228,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 2060
+ },
+ {
+ "entropy": 0.20453082229942082,
+ "epoch": 5.174346201743462,
+ "grad_norm": 0.7515555620193481,
+ "learning_rate": 0.00012607927442550974,
+ "loss": 0.13732000589370727,
+ "mean_token_accuracy": 0.9537357829511166,
+ "num_tokens": 4857965.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.174346201743462,
+ "eval_entropy": 0.32431264914745506,
+ "eval_loss": 0.6743043065071106,
+ "eval_mean_token_accuracy": 0.8504878629085629,
+ "eval_num_tokens": 4857965.0,
+ "eval_runtime": 86.5948,
+ "eval_samples_per_second": 15.879,
+ "eval_steps_per_second": 1.986,
+ "step": 2080
+ },
+ {
+ "entropy": 0.21812320686876774,
+ "epoch": 5.224159402241594,
+ "grad_norm": 0.9093465209007263,
+ "learning_rate": 0.0001241254770810132,
+ "loss": 0.14311420917510986,
+ "mean_token_accuracy": 0.9514068141579628,
+ "num_tokens": 4905151.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.224159402241594,
+ "eval_entropy": 0.33086285835435225,
+ "eval_loss": 0.6676449179649353,
+ "eval_mean_token_accuracy": 0.8505287662495015,
+ "eval_num_tokens": 4905151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 2100
+ },
+ {
+ "entropy": 0.2180163251236081,
+ "epoch": 5.273972602739726,
+ "grad_norm": 0.6703007221221924,
+ "learning_rate": 0.00012216836658457075,
+ "loss": 0.14803968667984008,
+ "mean_token_accuracy": 0.9521303348243236,
+ "num_tokens": 4947072.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.273972602739726,
+ "eval_entropy": 0.33162341708707255,
+ "eval_loss": 0.6658875942230225,
+ "eval_mean_token_accuracy": 0.8500757605530495,
+ "eval_num_tokens": 4947072.0,
+ "eval_runtime": 86.6296,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 2120
+ },
+ {
+ "entropy": 0.22511130161583423,
+ "epoch": 5.323785803237858,
+ "grad_norm": 0.8078880906105042,
+ "learning_rate": 0.00012020853317401455,
+ "loss": 0.15228408575057983,
+ "mean_token_accuracy": 0.947144789993763,
+ "num_tokens": 4991974.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.323785803237858,
+ "eval_entropy": 0.3354601170434508,
+ "eval_loss": 0.6677829623222351,
+ "eval_mean_token_accuracy": 0.8482600024273229,
+ "eval_num_tokens": 4991974.0,
+ "eval_runtime": 86.4689,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.989,
+ "step": 2140
+ },
+ {
+ "entropy": 0.2244176059961319,
+ "epoch": 5.37359900373599,
+ "grad_norm": 0.9636075496673584,
+ "learning_rate": 0.00011824656790837037,
+ "loss": 0.15260883569717407,
+ "mean_token_accuracy": 0.9471467643976211,
+ "num_tokens": 5038400.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.37359900373599,
+ "eval_entropy": 0.3381616926297199,
+ "eval_loss": 0.6694412231445312,
+ "eval_mean_token_accuracy": 0.8482369603805764,
+ "eval_num_tokens": 5038400.0,
+ "eval_runtime": 86.4147,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 2160
+ },
+ {
+ "entropy": 0.22982364390045404,
+ "epoch": 5.423412204234122,
+ "grad_norm": 0.775401771068573,
+ "learning_rate": 0.00011628306248960262,
+ "loss": 0.15140302181243898,
+ "mean_token_accuracy": 0.9492553934454918,
+ "num_tokens": 5083166.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.423412204234122,
+ "eval_entropy": 0.3305150235808173,
+ "eval_loss": 0.6717822551727295,
+ "eval_mean_token_accuracy": 0.8489849723355715,
+ "eval_num_tokens": 5083166.0,
+ "eval_runtime": 86.4728,
+ "eval_samples_per_second": 15.901,
+ "eval_steps_per_second": 1.989,
+ "step": 2180
+ },
+ {
+ "entropy": 0.21448935717344284,
+ "epoch": 5.473225404732254,
+ "grad_norm": 0.6575281023979187,
+ "learning_rate": 0.00011431860908416465,
+ "loss": 0.1452319622039795,
+ "mean_token_accuracy": 0.9505287684500218,
+ "num_tokens": 5135109.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.473225404732254,
+ "eval_entropy": 0.3488145174328671,
+ "eval_loss": 0.6612305641174316,
+ "eval_mean_token_accuracy": 0.8492907808963642,
+ "eval_num_tokens": 5135109.0,
+ "eval_runtime": 86.6927,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 2200
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.1719847891615744e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2220/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2220/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2220/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2220/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2220/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2220/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2220/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2220/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2220/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2220/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2220/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2220/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2220/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2220/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..16b93c6b2107d08fefd695cc5b5c8d26876a3084
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2220/trainer_state.json
@@ -0,0 +1,2365 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 5.523038605230386,
+ "eval_steps": 20,
+ "global_step": 2220,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ },
+ {
+ "entropy": 0.3193941755220294,
+ "epoch": 4.5280199252802,
+ "grad_norm": 0.8281906843185425,
+ "learning_rate": 0.0001509111761786888,
+ "loss": 0.23936262130737304,
+ "mean_token_accuracy": 0.9201708927750587,
+ "num_tokens": 4244423.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.5280199252802,
+ "eval_entropy": 0.38704028864239537,
+ "eval_loss": 0.6006569266319275,
+ "eval_mean_token_accuracy": 0.8502406720505205,
+ "eval_num_tokens": 4244423.0,
+ "eval_runtime": 86.8059,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1820
+ },
+ {
+ "entropy": 0.3164879363030195,
+ "epoch": 4.577833125778331,
+ "grad_norm": 0.7892968654632568,
+ "learning_rate": 0.00014905346557909867,
+ "loss": 0.24541733264923096,
+ "mean_token_accuracy": 0.9175932116806507,
+ "num_tokens": 4289773.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.577833125778331,
+ "eval_entropy": 0.38861122120951497,
+ "eval_loss": 0.6115967631340027,
+ "eval_mean_token_accuracy": 0.849471275196519,
+ "eval_num_tokens": 4289773.0,
+ "eval_runtime": 86.2946,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1840
+ },
+ {
+ "entropy": 0.3051785985007882,
+ "epoch": 4.627646326276463,
+ "grad_norm": 0.8109654188156128,
+ "learning_rate": 0.0001471849238862319,
+ "loss": 0.23433220386505127,
+ "mean_token_accuracy": 0.9206570319831371,
+ "num_tokens": 4336894.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.627646326276463,
+ "eval_entropy": 0.37162452295076015,
+ "eval_loss": 0.6184061765670776,
+ "eval_mean_token_accuracy": 0.8501173268223918,
+ "eval_num_tokens": 4336894.0,
+ "eval_runtime": 86.6865,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1860
+ },
+ {
+ "entropy": 0.3168198253959417,
+ "epoch": 4.677459526774595,
+ "grad_norm": 0.9512342214584351,
+ "learning_rate": 0.0001453061146267775,
+ "loss": 0.23832404613494873,
+ "mean_token_accuracy": 0.9197044663131237,
+ "num_tokens": 4382947.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.677459526774595,
+ "eval_entropy": 0.3845940856912801,
+ "eval_loss": 0.606762707233429,
+ "eval_mean_token_accuracy": 0.8504838194957999,
+ "eval_num_tokens": 4382947.0,
+ "eval_runtime": 86.5175,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 1880
+ },
+ {
+ "entropy": 0.30791807882487776,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 0.8123113512992859,
+ "learning_rate": 0.00014341760442398248,
+ "loss": 0.2395785331726074,
+ "mean_token_accuracy": 0.918928150832653,
+ "num_tokens": 4433050.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.7272727272727275,
+ "eval_entropy": 0.39762327222283494,
+ "eval_loss": 0.5994202494621277,
+ "eval_mean_token_accuracy": 0.8509274201337681,
+ "eval_num_tokens": 4433050.0,
+ "eval_runtime": 86.2873,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.993,
+ "step": 1900
+ },
+ {
+ "entropy": 0.3021434534341097,
+ "epoch": 4.777085927770859,
+ "grad_norm": 0.731787383556366,
+ "learning_rate": 0.000141519962826766,
+ "loss": 0.23494718074798585,
+ "mean_token_accuracy": 0.9201403826475143,
+ "num_tokens": 4483598.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.777085927770859,
+ "eval_entropy": 0.3827026732439219,
+ "eval_loss": 0.5995895862579346,
+ "eval_mean_token_accuracy": 0.851468373523202,
+ "eval_num_tokens": 4483598.0,
+ "eval_runtime": 86.3006,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 1920
+ },
+ {
+ "entropy": 0.31626159623265265,
+ "epoch": 4.826899128268991,
+ "grad_norm": 0.8848487138748169,
+ "learning_rate": 0.00013961376213795132,
+ "loss": 0.2439030647277832,
+ "mean_token_accuracy": 0.9196575872600079,
+ "num_tokens": 4529201.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.826899128268991,
+ "eval_entropy": 0.388698436839636,
+ "eval_loss": 0.6000174283981323,
+ "eval_mean_token_accuracy": 0.8518068187458571,
+ "eval_num_tokens": 4529201.0,
+ "eval_runtime": 86.8979,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.979,
+ "step": 1940
+ },
+ {
+ "entropy": 0.30520407035946845,
+ "epoch": 4.876712328767123,
+ "grad_norm": 0.8532460927963257,
+ "learning_rate": 0.00013769957724166695,
+ "loss": 0.23458616733551024,
+ "mean_token_accuracy": 0.9221912942826748,
+ "num_tokens": 4578167.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.876712328767123,
+ "eval_entropy": 0.38777847102908203,
+ "eval_loss": 0.6004981398582458,
+ "eval_mean_token_accuracy": 0.8516481768253238,
+ "eval_num_tokens": 4578167.0,
+ "eval_runtime": 87.0777,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.975,
+ "step": 1960
+ },
+ {
+ "entropy": 0.3226448342204094,
+ "epoch": 4.926525529265255,
+ "grad_norm": 0.6945561766624451,
+ "learning_rate": 0.0001357779854299694,
+ "loss": 0.24048397541046143,
+ "mean_token_accuracy": 0.9195300146937371,
+ "num_tokens": 4622316.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.926525529265255,
+ "eval_entropy": 0.38581624263247777,
+ "eval_loss": 0.6029234528541565,
+ "eval_mean_token_accuracy": 0.8514213260523108,
+ "eval_num_tokens": 4622316.0,
+ "eval_runtime": 85.8729,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 1980
+ },
+ {
+ "entropy": 0.3051655298098922,
+ "epoch": 4.976338729763388,
+ "grad_norm": 0.7976452708244324,
+ "learning_rate": 0.00013384956622874001,
+ "loss": 0.23584742546081544,
+ "mean_token_accuracy": 0.9216851457953453,
+ "num_tokens": 4670746.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.976338729763388,
+ "eval_entropy": 0.37913159246361533,
+ "eval_loss": 0.6057604551315308,
+ "eval_mean_token_accuracy": 0.8525801203971686,
+ "eval_num_tokens": 4670746.0,
+ "eval_runtime": 86.1145,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2000
+ },
+ {
+ "entropy": 0.27438195240803254,
+ "epoch": 5.024906600249066,
+ "grad_norm": 0.6729586124420166,
+ "learning_rate": 0.0001319149012229075,
+ "loss": 0.19775952100753785,
+ "mean_token_accuracy": 0.9339428559327737,
+ "num_tokens": 4716176.0,
+ "step": 2020
+ },
+ {
+ "epoch": 5.024906600249066,
+ "eval_entropy": 0.3448961910813354,
+ "eval_loss": 0.6750120520591736,
+ "eval_mean_token_accuracy": 0.8487970232963562,
+ "eval_num_tokens": 4716176.0,
+ "eval_runtime": 86.1169,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2020
+ },
+ {
+ "entropy": 0.21423916313797237,
+ "epoch": 5.074719800747198,
+ "grad_norm": 0.6934391856193542,
+ "learning_rate": 0.00012997457388105022,
+ "loss": 0.1439570426940918,
+ "mean_token_accuracy": 0.9528236843645572,
+ "num_tokens": 4763269.0,
+ "step": 2040
+ },
+ {
+ "epoch": 5.074719800747198,
+ "eval_entropy": 0.3570949243771475,
+ "eval_loss": 0.6465504169464111,
+ "eval_mean_token_accuracy": 0.8490785547467166,
+ "eval_num_tokens": 4763269.0,
+ "eval_runtime": 85.9574,
+ "eval_samples_per_second": 15.996,
+ "eval_steps_per_second": 2.001,
+ "step": 2040
+ },
+ {
+ "entropy": 0.20838565267622472,
+ "epoch": 5.12453300124533,
+ "grad_norm": 0.7286986112594604,
+ "learning_rate": 0.00012802916937942972,
+ "loss": 0.14467307329177856,
+ "mean_token_accuracy": 0.950994835793972,
+ "num_tokens": 4809047.0,
+ "step": 2060
+ },
+ {
+ "epoch": 5.12453300124533,
+ "eval_entropy": 0.3452463157821533,
+ "eval_loss": 0.6705958843231201,
+ "eval_mean_token_accuracy": 0.8490352796953778,
+ "eval_num_tokens": 4809047.0,
+ "eval_runtime": 86.228,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 2060
+ },
+ {
+ "entropy": 0.20453082229942082,
+ "epoch": 5.174346201743462,
+ "grad_norm": 0.7515555620193481,
+ "learning_rate": 0.00012607927442550974,
+ "loss": 0.13732000589370727,
+ "mean_token_accuracy": 0.9537357829511166,
+ "num_tokens": 4857965.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.174346201743462,
+ "eval_entropy": 0.32431264914745506,
+ "eval_loss": 0.6743043065071106,
+ "eval_mean_token_accuracy": 0.8504878629085629,
+ "eval_num_tokens": 4857965.0,
+ "eval_runtime": 86.5948,
+ "eval_samples_per_second": 15.879,
+ "eval_steps_per_second": 1.986,
+ "step": 2080
+ },
+ {
+ "entropy": 0.21812320686876774,
+ "epoch": 5.224159402241594,
+ "grad_norm": 0.9093465209007263,
+ "learning_rate": 0.0001241254770810132,
+ "loss": 0.14311420917510986,
+ "mean_token_accuracy": 0.9514068141579628,
+ "num_tokens": 4905151.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.224159402241594,
+ "eval_entropy": 0.33086285835435225,
+ "eval_loss": 0.6676449179649353,
+ "eval_mean_token_accuracy": 0.8505287662495015,
+ "eval_num_tokens": 4905151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 2100
+ },
+ {
+ "entropy": 0.2180163251236081,
+ "epoch": 5.273972602739726,
+ "grad_norm": 0.6703007221221924,
+ "learning_rate": 0.00012216836658457075,
+ "loss": 0.14803968667984008,
+ "mean_token_accuracy": 0.9521303348243236,
+ "num_tokens": 4947072.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.273972602739726,
+ "eval_entropy": 0.33162341708707255,
+ "eval_loss": 0.6658875942230225,
+ "eval_mean_token_accuracy": 0.8500757605530495,
+ "eval_num_tokens": 4947072.0,
+ "eval_runtime": 86.6296,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 2120
+ },
+ {
+ "entropy": 0.22511130161583423,
+ "epoch": 5.323785803237858,
+ "grad_norm": 0.8078880906105042,
+ "learning_rate": 0.00012020853317401455,
+ "loss": 0.15228408575057983,
+ "mean_token_accuracy": 0.947144789993763,
+ "num_tokens": 4991974.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.323785803237858,
+ "eval_entropy": 0.3354601170434508,
+ "eval_loss": 0.6677829623222351,
+ "eval_mean_token_accuracy": 0.8482600024273229,
+ "eval_num_tokens": 4991974.0,
+ "eval_runtime": 86.4689,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.989,
+ "step": 2140
+ },
+ {
+ "entropy": 0.2244176059961319,
+ "epoch": 5.37359900373599,
+ "grad_norm": 0.9636075496673584,
+ "learning_rate": 0.00011824656790837037,
+ "loss": 0.15260883569717407,
+ "mean_token_accuracy": 0.9471467643976211,
+ "num_tokens": 5038400.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.37359900373599,
+ "eval_entropy": 0.3381616926297199,
+ "eval_loss": 0.6694412231445312,
+ "eval_mean_token_accuracy": 0.8482369603805764,
+ "eval_num_tokens": 5038400.0,
+ "eval_runtime": 86.4147,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 2160
+ },
+ {
+ "entropy": 0.22982364390045404,
+ "epoch": 5.423412204234122,
+ "grad_norm": 0.775401771068573,
+ "learning_rate": 0.00011628306248960262,
+ "loss": 0.15140302181243898,
+ "mean_token_accuracy": 0.9492553934454918,
+ "num_tokens": 5083166.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.423412204234122,
+ "eval_entropy": 0.3305150235808173,
+ "eval_loss": 0.6717822551727295,
+ "eval_mean_token_accuracy": 0.8489849723355715,
+ "eval_num_tokens": 5083166.0,
+ "eval_runtime": 86.4728,
+ "eval_samples_per_second": 15.901,
+ "eval_steps_per_second": 1.989,
+ "step": 2180
+ },
+ {
+ "entropy": 0.21448935717344284,
+ "epoch": 5.473225404732254,
+ "grad_norm": 0.6575281023979187,
+ "learning_rate": 0.00011431860908416465,
+ "loss": 0.1452319622039795,
+ "mean_token_accuracy": 0.9505287684500218,
+ "num_tokens": 5135109.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.473225404732254,
+ "eval_entropy": 0.3488145174328671,
+ "eval_loss": 0.6612305641174316,
+ "eval_mean_token_accuracy": 0.8492907808963642,
+ "eval_num_tokens": 5135109.0,
+ "eval_runtime": 86.6927,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 2200
+ },
+ {
+ "entropy": 0.23091202937066554,
+ "epoch": 5.523038605230386,
+ "grad_norm": 0.8909686207771301,
+ "learning_rate": 0.00011235380014440985,
+ "loss": 0.15150139331817628,
+ "mean_token_accuracy": 0.9497875183820724,
+ "num_tokens": 5180138.0,
+ "step": 2220
+ },
+ {
+ "epoch": 5.523038605230386,
+ "eval_entropy": 0.3268539015810157,
+ "eval_loss": 0.6667542457580566,
+ "eval_mean_token_accuracy": 0.8499062903398691,
+ "eval_num_tokens": 5180138.0,
+ "eval_runtime": 86.4644,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 2220
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.190705638955172e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2240/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2240/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2240/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2240/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2240/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2240/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2240/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2240/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2240/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2240/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2240/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2240/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2240/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2240/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..a4adca15dfa7eeeeef7b21c2d75f3c38f596aa7e
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2240/trainer_state.json
@@ -0,0 +1,2386 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 5.572851805728518,
+ "eval_steps": 20,
+ "global_step": 2240,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ },
+ {
+ "entropy": 0.3193941755220294,
+ "epoch": 4.5280199252802,
+ "grad_norm": 0.8281906843185425,
+ "learning_rate": 0.0001509111761786888,
+ "loss": 0.23936262130737304,
+ "mean_token_accuracy": 0.9201708927750587,
+ "num_tokens": 4244423.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.5280199252802,
+ "eval_entropy": 0.38704028864239537,
+ "eval_loss": 0.6006569266319275,
+ "eval_mean_token_accuracy": 0.8502406720505205,
+ "eval_num_tokens": 4244423.0,
+ "eval_runtime": 86.8059,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1820
+ },
+ {
+ "entropy": 0.3164879363030195,
+ "epoch": 4.577833125778331,
+ "grad_norm": 0.7892968654632568,
+ "learning_rate": 0.00014905346557909867,
+ "loss": 0.24541733264923096,
+ "mean_token_accuracy": 0.9175932116806507,
+ "num_tokens": 4289773.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.577833125778331,
+ "eval_entropy": 0.38861122120951497,
+ "eval_loss": 0.6115967631340027,
+ "eval_mean_token_accuracy": 0.849471275196519,
+ "eval_num_tokens": 4289773.0,
+ "eval_runtime": 86.2946,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1840
+ },
+ {
+ "entropy": 0.3051785985007882,
+ "epoch": 4.627646326276463,
+ "grad_norm": 0.8109654188156128,
+ "learning_rate": 0.0001471849238862319,
+ "loss": 0.23433220386505127,
+ "mean_token_accuracy": 0.9206570319831371,
+ "num_tokens": 4336894.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.627646326276463,
+ "eval_entropy": 0.37162452295076015,
+ "eval_loss": 0.6184061765670776,
+ "eval_mean_token_accuracy": 0.8501173268223918,
+ "eval_num_tokens": 4336894.0,
+ "eval_runtime": 86.6865,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1860
+ },
+ {
+ "entropy": 0.3168198253959417,
+ "epoch": 4.677459526774595,
+ "grad_norm": 0.9512342214584351,
+ "learning_rate": 0.0001453061146267775,
+ "loss": 0.23832404613494873,
+ "mean_token_accuracy": 0.9197044663131237,
+ "num_tokens": 4382947.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.677459526774595,
+ "eval_entropy": 0.3845940856912801,
+ "eval_loss": 0.606762707233429,
+ "eval_mean_token_accuracy": 0.8504838194957999,
+ "eval_num_tokens": 4382947.0,
+ "eval_runtime": 86.5175,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 1880
+ },
+ {
+ "entropy": 0.30791807882487776,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 0.8123113512992859,
+ "learning_rate": 0.00014341760442398248,
+ "loss": 0.2395785331726074,
+ "mean_token_accuracy": 0.918928150832653,
+ "num_tokens": 4433050.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.7272727272727275,
+ "eval_entropy": 0.39762327222283494,
+ "eval_loss": 0.5994202494621277,
+ "eval_mean_token_accuracy": 0.8509274201337681,
+ "eval_num_tokens": 4433050.0,
+ "eval_runtime": 86.2873,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.993,
+ "step": 1900
+ },
+ {
+ "entropy": 0.3021434534341097,
+ "epoch": 4.777085927770859,
+ "grad_norm": 0.731787383556366,
+ "learning_rate": 0.000141519962826766,
+ "loss": 0.23494718074798585,
+ "mean_token_accuracy": 0.9201403826475143,
+ "num_tokens": 4483598.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.777085927770859,
+ "eval_entropy": 0.3827026732439219,
+ "eval_loss": 0.5995895862579346,
+ "eval_mean_token_accuracy": 0.851468373523202,
+ "eval_num_tokens": 4483598.0,
+ "eval_runtime": 86.3006,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 1920
+ },
+ {
+ "entropy": 0.31626159623265265,
+ "epoch": 4.826899128268991,
+ "grad_norm": 0.8848487138748169,
+ "learning_rate": 0.00013961376213795132,
+ "loss": 0.2439030647277832,
+ "mean_token_accuracy": 0.9196575872600079,
+ "num_tokens": 4529201.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.826899128268991,
+ "eval_entropy": 0.388698436839636,
+ "eval_loss": 0.6000174283981323,
+ "eval_mean_token_accuracy": 0.8518068187458571,
+ "eval_num_tokens": 4529201.0,
+ "eval_runtime": 86.8979,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.979,
+ "step": 1940
+ },
+ {
+ "entropy": 0.30520407035946845,
+ "epoch": 4.876712328767123,
+ "grad_norm": 0.8532460927963257,
+ "learning_rate": 0.00013769957724166695,
+ "loss": 0.23458616733551024,
+ "mean_token_accuracy": 0.9221912942826748,
+ "num_tokens": 4578167.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.876712328767123,
+ "eval_entropy": 0.38777847102908203,
+ "eval_loss": 0.6004981398582458,
+ "eval_mean_token_accuracy": 0.8516481768253238,
+ "eval_num_tokens": 4578167.0,
+ "eval_runtime": 87.0777,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.975,
+ "step": 1960
+ },
+ {
+ "entropy": 0.3226448342204094,
+ "epoch": 4.926525529265255,
+ "grad_norm": 0.6945561766624451,
+ "learning_rate": 0.0001357779854299694,
+ "loss": 0.24048397541046143,
+ "mean_token_accuracy": 0.9195300146937371,
+ "num_tokens": 4622316.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.926525529265255,
+ "eval_entropy": 0.38581624263247777,
+ "eval_loss": 0.6029234528541565,
+ "eval_mean_token_accuracy": 0.8514213260523108,
+ "eval_num_tokens": 4622316.0,
+ "eval_runtime": 85.8729,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 1980
+ },
+ {
+ "entropy": 0.3051655298098922,
+ "epoch": 4.976338729763388,
+ "grad_norm": 0.7976452708244324,
+ "learning_rate": 0.00013384956622874001,
+ "loss": 0.23584742546081544,
+ "mean_token_accuracy": 0.9216851457953453,
+ "num_tokens": 4670746.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.976338729763388,
+ "eval_entropy": 0.37913159246361533,
+ "eval_loss": 0.6057604551315308,
+ "eval_mean_token_accuracy": 0.8525801203971686,
+ "eval_num_tokens": 4670746.0,
+ "eval_runtime": 86.1145,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2000
+ },
+ {
+ "entropy": 0.27438195240803254,
+ "epoch": 5.024906600249066,
+ "grad_norm": 0.6729586124420166,
+ "learning_rate": 0.0001319149012229075,
+ "loss": 0.19775952100753785,
+ "mean_token_accuracy": 0.9339428559327737,
+ "num_tokens": 4716176.0,
+ "step": 2020
+ },
+ {
+ "epoch": 5.024906600249066,
+ "eval_entropy": 0.3448961910813354,
+ "eval_loss": 0.6750120520591736,
+ "eval_mean_token_accuracy": 0.8487970232963562,
+ "eval_num_tokens": 4716176.0,
+ "eval_runtime": 86.1169,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2020
+ },
+ {
+ "entropy": 0.21423916313797237,
+ "epoch": 5.074719800747198,
+ "grad_norm": 0.6934391856193542,
+ "learning_rate": 0.00012997457388105022,
+ "loss": 0.1439570426940918,
+ "mean_token_accuracy": 0.9528236843645572,
+ "num_tokens": 4763269.0,
+ "step": 2040
+ },
+ {
+ "epoch": 5.074719800747198,
+ "eval_entropy": 0.3570949243771475,
+ "eval_loss": 0.6465504169464111,
+ "eval_mean_token_accuracy": 0.8490785547467166,
+ "eval_num_tokens": 4763269.0,
+ "eval_runtime": 85.9574,
+ "eval_samples_per_second": 15.996,
+ "eval_steps_per_second": 2.001,
+ "step": 2040
+ },
+ {
+ "entropy": 0.20838565267622472,
+ "epoch": 5.12453300124533,
+ "grad_norm": 0.7286986112594604,
+ "learning_rate": 0.00012802916937942972,
+ "loss": 0.14467307329177856,
+ "mean_token_accuracy": 0.950994835793972,
+ "num_tokens": 4809047.0,
+ "step": 2060
+ },
+ {
+ "epoch": 5.12453300124533,
+ "eval_entropy": 0.3452463157821533,
+ "eval_loss": 0.6705958843231201,
+ "eval_mean_token_accuracy": 0.8490352796953778,
+ "eval_num_tokens": 4809047.0,
+ "eval_runtime": 86.228,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 2060
+ },
+ {
+ "entropy": 0.20453082229942082,
+ "epoch": 5.174346201743462,
+ "grad_norm": 0.7515555620193481,
+ "learning_rate": 0.00012607927442550974,
+ "loss": 0.13732000589370727,
+ "mean_token_accuracy": 0.9537357829511166,
+ "num_tokens": 4857965.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.174346201743462,
+ "eval_entropy": 0.32431264914745506,
+ "eval_loss": 0.6743043065071106,
+ "eval_mean_token_accuracy": 0.8504878629085629,
+ "eval_num_tokens": 4857965.0,
+ "eval_runtime": 86.5948,
+ "eval_samples_per_second": 15.879,
+ "eval_steps_per_second": 1.986,
+ "step": 2080
+ },
+ {
+ "entropy": 0.21812320686876774,
+ "epoch": 5.224159402241594,
+ "grad_norm": 0.9093465209007263,
+ "learning_rate": 0.0001241254770810132,
+ "loss": 0.14311420917510986,
+ "mean_token_accuracy": 0.9514068141579628,
+ "num_tokens": 4905151.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.224159402241594,
+ "eval_entropy": 0.33086285835435225,
+ "eval_loss": 0.6676449179649353,
+ "eval_mean_token_accuracy": 0.8505287662495015,
+ "eval_num_tokens": 4905151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 2100
+ },
+ {
+ "entropy": 0.2180163251236081,
+ "epoch": 5.273972602739726,
+ "grad_norm": 0.6703007221221924,
+ "learning_rate": 0.00012216836658457075,
+ "loss": 0.14803968667984008,
+ "mean_token_accuracy": 0.9521303348243236,
+ "num_tokens": 4947072.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.273972602739726,
+ "eval_entropy": 0.33162341708707255,
+ "eval_loss": 0.6658875942230225,
+ "eval_mean_token_accuracy": 0.8500757605530495,
+ "eval_num_tokens": 4947072.0,
+ "eval_runtime": 86.6296,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 2120
+ },
+ {
+ "entropy": 0.22511130161583423,
+ "epoch": 5.323785803237858,
+ "grad_norm": 0.8078880906105042,
+ "learning_rate": 0.00012020853317401455,
+ "loss": 0.15228408575057983,
+ "mean_token_accuracy": 0.947144789993763,
+ "num_tokens": 4991974.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.323785803237858,
+ "eval_entropy": 0.3354601170434508,
+ "eval_loss": 0.6677829623222351,
+ "eval_mean_token_accuracy": 0.8482600024273229,
+ "eval_num_tokens": 4991974.0,
+ "eval_runtime": 86.4689,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.989,
+ "step": 2140
+ },
+ {
+ "entropy": 0.2244176059961319,
+ "epoch": 5.37359900373599,
+ "grad_norm": 0.9636075496673584,
+ "learning_rate": 0.00011824656790837037,
+ "loss": 0.15260883569717407,
+ "mean_token_accuracy": 0.9471467643976211,
+ "num_tokens": 5038400.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.37359900373599,
+ "eval_entropy": 0.3381616926297199,
+ "eval_loss": 0.6694412231445312,
+ "eval_mean_token_accuracy": 0.8482369603805764,
+ "eval_num_tokens": 5038400.0,
+ "eval_runtime": 86.4147,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 2160
+ },
+ {
+ "entropy": 0.22982364390045404,
+ "epoch": 5.423412204234122,
+ "grad_norm": 0.775401771068573,
+ "learning_rate": 0.00011628306248960262,
+ "loss": 0.15140302181243898,
+ "mean_token_accuracy": 0.9492553934454918,
+ "num_tokens": 5083166.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.423412204234122,
+ "eval_entropy": 0.3305150235808173,
+ "eval_loss": 0.6717822551727295,
+ "eval_mean_token_accuracy": 0.8489849723355715,
+ "eval_num_tokens": 5083166.0,
+ "eval_runtime": 86.4728,
+ "eval_samples_per_second": 15.901,
+ "eval_steps_per_second": 1.989,
+ "step": 2180
+ },
+ {
+ "entropy": 0.21448935717344284,
+ "epoch": 5.473225404732254,
+ "grad_norm": 0.6575281023979187,
+ "learning_rate": 0.00011431860908416465,
+ "loss": 0.1452319622039795,
+ "mean_token_accuracy": 0.9505287684500218,
+ "num_tokens": 5135109.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.473225404732254,
+ "eval_entropy": 0.3488145174328671,
+ "eval_loss": 0.6612305641174316,
+ "eval_mean_token_accuracy": 0.8492907808963642,
+ "eval_num_tokens": 5135109.0,
+ "eval_runtime": 86.6927,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 2200
+ },
+ {
+ "entropy": 0.23091202937066554,
+ "epoch": 5.523038605230386,
+ "grad_norm": 0.8909686207771301,
+ "learning_rate": 0.00011235380014440985,
+ "loss": 0.15150139331817628,
+ "mean_token_accuracy": 0.9497875183820724,
+ "num_tokens": 5180138.0,
+ "step": 2220
+ },
+ {
+ "epoch": 5.523038605230386,
+ "eval_entropy": 0.3268539015810157,
+ "eval_loss": 0.6667542457580566,
+ "eval_mean_token_accuracy": 0.8499062903398691,
+ "eval_num_tokens": 5180138.0,
+ "eval_runtime": 86.4644,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 2220
+ },
+ {
+ "entropy": 0.2227974807843566,
+ "epoch": 5.572851805728518,
+ "grad_norm": 0.6180275082588196,
+ "learning_rate": 0.0001103892282299158,
+ "loss": 0.1491069197654724,
+ "mean_token_accuracy": 0.9488144010305405,
+ "num_tokens": 5226864.0,
+ "step": 2240
+ },
+ {
+ "epoch": 5.572851805728518,
+ "eval_entropy": 0.3346347655494546,
+ "eval_loss": 0.6665948629379272,
+ "eval_mean_token_accuracy": 0.8499961893918903,
+ "eval_num_tokens": 5226864.0,
+ "eval_runtime": 87.0548,
+ "eval_samples_per_second": 15.795,
+ "eval_steps_per_second": 1.976,
+ "step": 2240
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.2098716889931776e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2260/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2260/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2260/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2260/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2260/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2260/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2260/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2260/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2260/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2260/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2260/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2260/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2260/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2260/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..59b6209d1cc9854c841419870071e020325cd77d
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2260/trainer_state.json
@@ -0,0 +1,2407 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 5.62266500622665,
+ "eval_steps": 20,
+ "global_step": 2260,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ },
+ {
+ "entropy": 0.3193941755220294,
+ "epoch": 4.5280199252802,
+ "grad_norm": 0.8281906843185425,
+ "learning_rate": 0.0001509111761786888,
+ "loss": 0.23936262130737304,
+ "mean_token_accuracy": 0.9201708927750587,
+ "num_tokens": 4244423.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.5280199252802,
+ "eval_entropy": 0.38704028864239537,
+ "eval_loss": 0.6006569266319275,
+ "eval_mean_token_accuracy": 0.8502406720505205,
+ "eval_num_tokens": 4244423.0,
+ "eval_runtime": 86.8059,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1820
+ },
+ {
+ "entropy": 0.3164879363030195,
+ "epoch": 4.577833125778331,
+ "grad_norm": 0.7892968654632568,
+ "learning_rate": 0.00014905346557909867,
+ "loss": 0.24541733264923096,
+ "mean_token_accuracy": 0.9175932116806507,
+ "num_tokens": 4289773.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.577833125778331,
+ "eval_entropy": 0.38861122120951497,
+ "eval_loss": 0.6115967631340027,
+ "eval_mean_token_accuracy": 0.849471275196519,
+ "eval_num_tokens": 4289773.0,
+ "eval_runtime": 86.2946,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1840
+ },
+ {
+ "entropy": 0.3051785985007882,
+ "epoch": 4.627646326276463,
+ "grad_norm": 0.8109654188156128,
+ "learning_rate": 0.0001471849238862319,
+ "loss": 0.23433220386505127,
+ "mean_token_accuracy": 0.9206570319831371,
+ "num_tokens": 4336894.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.627646326276463,
+ "eval_entropy": 0.37162452295076015,
+ "eval_loss": 0.6184061765670776,
+ "eval_mean_token_accuracy": 0.8501173268223918,
+ "eval_num_tokens": 4336894.0,
+ "eval_runtime": 86.6865,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1860
+ },
+ {
+ "entropy": 0.3168198253959417,
+ "epoch": 4.677459526774595,
+ "grad_norm": 0.9512342214584351,
+ "learning_rate": 0.0001453061146267775,
+ "loss": 0.23832404613494873,
+ "mean_token_accuracy": 0.9197044663131237,
+ "num_tokens": 4382947.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.677459526774595,
+ "eval_entropy": 0.3845940856912801,
+ "eval_loss": 0.606762707233429,
+ "eval_mean_token_accuracy": 0.8504838194957999,
+ "eval_num_tokens": 4382947.0,
+ "eval_runtime": 86.5175,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 1880
+ },
+ {
+ "entropy": 0.30791807882487776,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 0.8123113512992859,
+ "learning_rate": 0.00014341760442398248,
+ "loss": 0.2395785331726074,
+ "mean_token_accuracy": 0.918928150832653,
+ "num_tokens": 4433050.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.7272727272727275,
+ "eval_entropy": 0.39762327222283494,
+ "eval_loss": 0.5994202494621277,
+ "eval_mean_token_accuracy": 0.8509274201337681,
+ "eval_num_tokens": 4433050.0,
+ "eval_runtime": 86.2873,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.993,
+ "step": 1900
+ },
+ {
+ "entropy": 0.3021434534341097,
+ "epoch": 4.777085927770859,
+ "grad_norm": 0.731787383556366,
+ "learning_rate": 0.000141519962826766,
+ "loss": 0.23494718074798585,
+ "mean_token_accuracy": 0.9201403826475143,
+ "num_tokens": 4483598.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.777085927770859,
+ "eval_entropy": 0.3827026732439219,
+ "eval_loss": 0.5995895862579346,
+ "eval_mean_token_accuracy": 0.851468373523202,
+ "eval_num_tokens": 4483598.0,
+ "eval_runtime": 86.3006,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 1920
+ },
+ {
+ "entropy": 0.31626159623265265,
+ "epoch": 4.826899128268991,
+ "grad_norm": 0.8848487138748169,
+ "learning_rate": 0.00013961376213795132,
+ "loss": 0.2439030647277832,
+ "mean_token_accuracy": 0.9196575872600079,
+ "num_tokens": 4529201.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.826899128268991,
+ "eval_entropy": 0.388698436839636,
+ "eval_loss": 0.6000174283981323,
+ "eval_mean_token_accuracy": 0.8518068187458571,
+ "eval_num_tokens": 4529201.0,
+ "eval_runtime": 86.8979,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.979,
+ "step": 1940
+ },
+ {
+ "entropy": 0.30520407035946845,
+ "epoch": 4.876712328767123,
+ "grad_norm": 0.8532460927963257,
+ "learning_rate": 0.00013769957724166695,
+ "loss": 0.23458616733551024,
+ "mean_token_accuracy": 0.9221912942826748,
+ "num_tokens": 4578167.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.876712328767123,
+ "eval_entropy": 0.38777847102908203,
+ "eval_loss": 0.6004981398582458,
+ "eval_mean_token_accuracy": 0.8516481768253238,
+ "eval_num_tokens": 4578167.0,
+ "eval_runtime": 87.0777,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.975,
+ "step": 1960
+ },
+ {
+ "entropy": 0.3226448342204094,
+ "epoch": 4.926525529265255,
+ "grad_norm": 0.6945561766624451,
+ "learning_rate": 0.0001357779854299694,
+ "loss": 0.24048397541046143,
+ "mean_token_accuracy": 0.9195300146937371,
+ "num_tokens": 4622316.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.926525529265255,
+ "eval_entropy": 0.38581624263247777,
+ "eval_loss": 0.6029234528541565,
+ "eval_mean_token_accuracy": 0.8514213260523108,
+ "eval_num_tokens": 4622316.0,
+ "eval_runtime": 85.8729,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 1980
+ },
+ {
+ "entropy": 0.3051655298098922,
+ "epoch": 4.976338729763388,
+ "grad_norm": 0.7976452708244324,
+ "learning_rate": 0.00013384956622874001,
+ "loss": 0.23584742546081544,
+ "mean_token_accuracy": 0.9216851457953453,
+ "num_tokens": 4670746.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.976338729763388,
+ "eval_entropy": 0.37913159246361533,
+ "eval_loss": 0.6057604551315308,
+ "eval_mean_token_accuracy": 0.8525801203971686,
+ "eval_num_tokens": 4670746.0,
+ "eval_runtime": 86.1145,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2000
+ },
+ {
+ "entropy": 0.27438195240803254,
+ "epoch": 5.024906600249066,
+ "grad_norm": 0.6729586124420166,
+ "learning_rate": 0.0001319149012229075,
+ "loss": 0.19775952100753785,
+ "mean_token_accuracy": 0.9339428559327737,
+ "num_tokens": 4716176.0,
+ "step": 2020
+ },
+ {
+ "epoch": 5.024906600249066,
+ "eval_entropy": 0.3448961910813354,
+ "eval_loss": 0.6750120520591736,
+ "eval_mean_token_accuracy": 0.8487970232963562,
+ "eval_num_tokens": 4716176.0,
+ "eval_runtime": 86.1169,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2020
+ },
+ {
+ "entropy": 0.21423916313797237,
+ "epoch": 5.074719800747198,
+ "grad_norm": 0.6934391856193542,
+ "learning_rate": 0.00012997457388105022,
+ "loss": 0.1439570426940918,
+ "mean_token_accuracy": 0.9528236843645572,
+ "num_tokens": 4763269.0,
+ "step": 2040
+ },
+ {
+ "epoch": 5.074719800747198,
+ "eval_entropy": 0.3570949243771475,
+ "eval_loss": 0.6465504169464111,
+ "eval_mean_token_accuracy": 0.8490785547467166,
+ "eval_num_tokens": 4763269.0,
+ "eval_runtime": 85.9574,
+ "eval_samples_per_second": 15.996,
+ "eval_steps_per_second": 2.001,
+ "step": 2040
+ },
+ {
+ "entropy": 0.20838565267622472,
+ "epoch": 5.12453300124533,
+ "grad_norm": 0.7286986112594604,
+ "learning_rate": 0.00012802916937942972,
+ "loss": 0.14467307329177856,
+ "mean_token_accuracy": 0.950994835793972,
+ "num_tokens": 4809047.0,
+ "step": 2060
+ },
+ {
+ "epoch": 5.12453300124533,
+ "eval_entropy": 0.3452463157821533,
+ "eval_loss": 0.6705958843231201,
+ "eval_mean_token_accuracy": 0.8490352796953778,
+ "eval_num_tokens": 4809047.0,
+ "eval_runtime": 86.228,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 2060
+ },
+ {
+ "entropy": 0.20453082229942082,
+ "epoch": 5.174346201743462,
+ "grad_norm": 0.7515555620193481,
+ "learning_rate": 0.00012607927442550974,
+ "loss": 0.13732000589370727,
+ "mean_token_accuracy": 0.9537357829511166,
+ "num_tokens": 4857965.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.174346201743462,
+ "eval_entropy": 0.32431264914745506,
+ "eval_loss": 0.6743043065071106,
+ "eval_mean_token_accuracy": 0.8504878629085629,
+ "eval_num_tokens": 4857965.0,
+ "eval_runtime": 86.5948,
+ "eval_samples_per_second": 15.879,
+ "eval_steps_per_second": 1.986,
+ "step": 2080
+ },
+ {
+ "entropy": 0.21812320686876774,
+ "epoch": 5.224159402241594,
+ "grad_norm": 0.9093465209007263,
+ "learning_rate": 0.0001241254770810132,
+ "loss": 0.14311420917510986,
+ "mean_token_accuracy": 0.9514068141579628,
+ "num_tokens": 4905151.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.224159402241594,
+ "eval_entropy": 0.33086285835435225,
+ "eval_loss": 0.6676449179649353,
+ "eval_mean_token_accuracy": 0.8505287662495015,
+ "eval_num_tokens": 4905151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 2100
+ },
+ {
+ "entropy": 0.2180163251236081,
+ "epoch": 5.273972602739726,
+ "grad_norm": 0.6703007221221924,
+ "learning_rate": 0.00012216836658457075,
+ "loss": 0.14803968667984008,
+ "mean_token_accuracy": 0.9521303348243236,
+ "num_tokens": 4947072.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.273972602739726,
+ "eval_entropy": 0.33162341708707255,
+ "eval_loss": 0.6658875942230225,
+ "eval_mean_token_accuracy": 0.8500757605530495,
+ "eval_num_tokens": 4947072.0,
+ "eval_runtime": 86.6296,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 2120
+ },
+ {
+ "entropy": 0.22511130161583423,
+ "epoch": 5.323785803237858,
+ "grad_norm": 0.8078880906105042,
+ "learning_rate": 0.00012020853317401455,
+ "loss": 0.15228408575057983,
+ "mean_token_accuracy": 0.947144789993763,
+ "num_tokens": 4991974.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.323785803237858,
+ "eval_entropy": 0.3354601170434508,
+ "eval_loss": 0.6677829623222351,
+ "eval_mean_token_accuracy": 0.8482600024273229,
+ "eval_num_tokens": 4991974.0,
+ "eval_runtime": 86.4689,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.989,
+ "step": 2140
+ },
+ {
+ "entropy": 0.2244176059961319,
+ "epoch": 5.37359900373599,
+ "grad_norm": 0.9636075496673584,
+ "learning_rate": 0.00011824656790837037,
+ "loss": 0.15260883569717407,
+ "mean_token_accuracy": 0.9471467643976211,
+ "num_tokens": 5038400.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.37359900373599,
+ "eval_entropy": 0.3381616926297199,
+ "eval_loss": 0.6694412231445312,
+ "eval_mean_token_accuracy": 0.8482369603805764,
+ "eval_num_tokens": 5038400.0,
+ "eval_runtime": 86.4147,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 2160
+ },
+ {
+ "entropy": 0.22982364390045404,
+ "epoch": 5.423412204234122,
+ "grad_norm": 0.775401771068573,
+ "learning_rate": 0.00011628306248960262,
+ "loss": 0.15140302181243898,
+ "mean_token_accuracy": 0.9492553934454918,
+ "num_tokens": 5083166.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.423412204234122,
+ "eval_entropy": 0.3305150235808173,
+ "eval_loss": 0.6717822551727295,
+ "eval_mean_token_accuracy": 0.8489849723355715,
+ "eval_num_tokens": 5083166.0,
+ "eval_runtime": 86.4728,
+ "eval_samples_per_second": 15.901,
+ "eval_steps_per_second": 1.989,
+ "step": 2180
+ },
+ {
+ "entropy": 0.21448935717344284,
+ "epoch": 5.473225404732254,
+ "grad_norm": 0.6575281023979187,
+ "learning_rate": 0.00011431860908416465,
+ "loss": 0.1452319622039795,
+ "mean_token_accuracy": 0.9505287684500218,
+ "num_tokens": 5135109.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.473225404732254,
+ "eval_entropy": 0.3488145174328671,
+ "eval_loss": 0.6612305641174316,
+ "eval_mean_token_accuracy": 0.8492907808963642,
+ "eval_num_tokens": 5135109.0,
+ "eval_runtime": 86.6927,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 2200
+ },
+ {
+ "entropy": 0.23091202937066554,
+ "epoch": 5.523038605230386,
+ "grad_norm": 0.8909686207771301,
+ "learning_rate": 0.00011235380014440985,
+ "loss": 0.15150139331817628,
+ "mean_token_accuracy": 0.9497875183820724,
+ "num_tokens": 5180138.0,
+ "step": 2220
+ },
+ {
+ "epoch": 5.523038605230386,
+ "eval_entropy": 0.3268539015810157,
+ "eval_loss": 0.6667542457580566,
+ "eval_mean_token_accuracy": 0.8499062903398691,
+ "eval_num_tokens": 5180138.0,
+ "eval_runtime": 86.4644,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 2220
+ },
+ {
+ "entropy": 0.2227974807843566,
+ "epoch": 5.572851805728518,
+ "grad_norm": 0.6180275082588196,
+ "learning_rate": 0.0001103892282299158,
+ "loss": 0.1491069197654724,
+ "mean_token_accuracy": 0.9488144010305405,
+ "num_tokens": 5226864.0,
+ "step": 2240
+ },
+ {
+ "epoch": 5.572851805728518,
+ "eval_entropy": 0.3346347655494546,
+ "eval_loss": 0.6665948629379272,
+ "eval_mean_token_accuracy": 0.8499961893918903,
+ "eval_num_tokens": 5226864.0,
+ "eval_runtime": 87.0548,
+ "eval_samples_per_second": 15.795,
+ "eval_steps_per_second": 1.976,
+ "step": 2240
+ },
+ {
+ "entropy": 0.21368421968072654,
+ "epoch": 5.62266500622665,
+ "grad_norm": 0.6004369258880615,
+ "learning_rate": 0.00010842548582877651,
+ "loss": 0.14485255479812623,
+ "mean_token_accuracy": 0.9502056457102299,
+ "num_tokens": 5276602.0,
+ "step": 2260
+ },
+ {
+ "epoch": 5.62266500622665,
+ "eval_entropy": 0.32753298804163933,
+ "eval_loss": 0.6680151224136353,
+ "eval_mean_token_accuracy": 0.8515451086121936,
+ "eval_num_tokens": 5276602.0,
+ "eval_runtime": 86.8524,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.98,
+ "step": 2260
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.2298195322023117e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2280/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2280/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2280/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2280/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2280/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2280/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2280/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2280/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2280/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2280/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2280/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2280/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2280/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2280/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..4c87189b4a0c1e0cb306bd80572895d705877337
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2280/trainer_state.json
@@ -0,0 +1,2428 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 5.672478206724782,
+ "eval_steps": 20,
+ "global_step": 2280,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ },
+ {
+ "entropy": 0.3193941755220294,
+ "epoch": 4.5280199252802,
+ "grad_norm": 0.8281906843185425,
+ "learning_rate": 0.0001509111761786888,
+ "loss": 0.23936262130737304,
+ "mean_token_accuracy": 0.9201708927750587,
+ "num_tokens": 4244423.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.5280199252802,
+ "eval_entropy": 0.38704028864239537,
+ "eval_loss": 0.6006569266319275,
+ "eval_mean_token_accuracy": 0.8502406720505205,
+ "eval_num_tokens": 4244423.0,
+ "eval_runtime": 86.8059,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1820
+ },
+ {
+ "entropy": 0.3164879363030195,
+ "epoch": 4.577833125778331,
+ "grad_norm": 0.7892968654632568,
+ "learning_rate": 0.00014905346557909867,
+ "loss": 0.24541733264923096,
+ "mean_token_accuracy": 0.9175932116806507,
+ "num_tokens": 4289773.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.577833125778331,
+ "eval_entropy": 0.38861122120951497,
+ "eval_loss": 0.6115967631340027,
+ "eval_mean_token_accuracy": 0.849471275196519,
+ "eval_num_tokens": 4289773.0,
+ "eval_runtime": 86.2946,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1840
+ },
+ {
+ "entropy": 0.3051785985007882,
+ "epoch": 4.627646326276463,
+ "grad_norm": 0.8109654188156128,
+ "learning_rate": 0.0001471849238862319,
+ "loss": 0.23433220386505127,
+ "mean_token_accuracy": 0.9206570319831371,
+ "num_tokens": 4336894.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.627646326276463,
+ "eval_entropy": 0.37162452295076015,
+ "eval_loss": 0.6184061765670776,
+ "eval_mean_token_accuracy": 0.8501173268223918,
+ "eval_num_tokens": 4336894.0,
+ "eval_runtime": 86.6865,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1860
+ },
+ {
+ "entropy": 0.3168198253959417,
+ "epoch": 4.677459526774595,
+ "grad_norm": 0.9512342214584351,
+ "learning_rate": 0.0001453061146267775,
+ "loss": 0.23832404613494873,
+ "mean_token_accuracy": 0.9197044663131237,
+ "num_tokens": 4382947.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.677459526774595,
+ "eval_entropy": 0.3845940856912801,
+ "eval_loss": 0.606762707233429,
+ "eval_mean_token_accuracy": 0.8504838194957999,
+ "eval_num_tokens": 4382947.0,
+ "eval_runtime": 86.5175,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 1880
+ },
+ {
+ "entropy": 0.30791807882487776,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 0.8123113512992859,
+ "learning_rate": 0.00014341760442398248,
+ "loss": 0.2395785331726074,
+ "mean_token_accuracy": 0.918928150832653,
+ "num_tokens": 4433050.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.7272727272727275,
+ "eval_entropy": 0.39762327222283494,
+ "eval_loss": 0.5994202494621277,
+ "eval_mean_token_accuracy": 0.8509274201337681,
+ "eval_num_tokens": 4433050.0,
+ "eval_runtime": 86.2873,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.993,
+ "step": 1900
+ },
+ {
+ "entropy": 0.3021434534341097,
+ "epoch": 4.777085927770859,
+ "grad_norm": 0.731787383556366,
+ "learning_rate": 0.000141519962826766,
+ "loss": 0.23494718074798585,
+ "mean_token_accuracy": 0.9201403826475143,
+ "num_tokens": 4483598.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.777085927770859,
+ "eval_entropy": 0.3827026732439219,
+ "eval_loss": 0.5995895862579346,
+ "eval_mean_token_accuracy": 0.851468373523202,
+ "eval_num_tokens": 4483598.0,
+ "eval_runtime": 86.3006,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 1920
+ },
+ {
+ "entropy": 0.31626159623265265,
+ "epoch": 4.826899128268991,
+ "grad_norm": 0.8848487138748169,
+ "learning_rate": 0.00013961376213795132,
+ "loss": 0.2439030647277832,
+ "mean_token_accuracy": 0.9196575872600079,
+ "num_tokens": 4529201.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.826899128268991,
+ "eval_entropy": 0.388698436839636,
+ "eval_loss": 0.6000174283981323,
+ "eval_mean_token_accuracy": 0.8518068187458571,
+ "eval_num_tokens": 4529201.0,
+ "eval_runtime": 86.8979,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.979,
+ "step": 1940
+ },
+ {
+ "entropy": 0.30520407035946845,
+ "epoch": 4.876712328767123,
+ "grad_norm": 0.8532460927963257,
+ "learning_rate": 0.00013769957724166695,
+ "loss": 0.23458616733551024,
+ "mean_token_accuracy": 0.9221912942826748,
+ "num_tokens": 4578167.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.876712328767123,
+ "eval_entropy": 0.38777847102908203,
+ "eval_loss": 0.6004981398582458,
+ "eval_mean_token_accuracy": 0.8516481768253238,
+ "eval_num_tokens": 4578167.0,
+ "eval_runtime": 87.0777,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.975,
+ "step": 1960
+ },
+ {
+ "entropy": 0.3226448342204094,
+ "epoch": 4.926525529265255,
+ "grad_norm": 0.6945561766624451,
+ "learning_rate": 0.0001357779854299694,
+ "loss": 0.24048397541046143,
+ "mean_token_accuracy": 0.9195300146937371,
+ "num_tokens": 4622316.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.926525529265255,
+ "eval_entropy": 0.38581624263247777,
+ "eval_loss": 0.6029234528541565,
+ "eval_mean_token_accuracy": 0.8514213260523108,
+ "eval_num_tokens": 4622316.0,
+ "eval_runtime": 85.8729,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 1980
+ },
+ {
+ "entropy": 0.3051655298098922,
+ "epoch": 4.976338729763388,
+ "grad_norm": 0.7976452708244324,
+ "learning_rate": 0.00013384956622874001,
+ "loss": 0.23584742546081544,
+ "mean_token_accuracy": 0.9216851457953453,
+ "num_tokens": 4670746.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.976338729763388,
+ "eval_entropy": 0.37913159246361533,
+ "eval_loss": 0.6057604551315308,
+ "eval_mean_token_accuracy": 0.8525801203971686,
+ "eval_num_tokens": 4670746.0,
+ "eval_runtime": 86.1145,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2000
+ },
+ {
+ "entropy": 0.27438195240803254,
+ "epoch": 5.024906600249066,
+ "grad_norm": 0.6729586124420166,
+ "learning_rate": 0.0001319149012229075,
+ "loss": 0.19775952100753785,
+ "mean_token_accuracy": 0.9339428559327737,
+ "num_tokens": 4716176.0,
+ "step": 2020
+ },
+ {
+ "epoch": 5.024906600249066,
+ "eval_entropy": 0.3448961910813354,
+ "eval_loss": 0.6750120520591736,
+ "eval_mean_token_accuracy": 0.8487970232963562,
+ "eval_num_tokens": 4716176.0,
+ "eval_runtime": 86.1169,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2020
+ },
+ {
+ "entropy": 0.21423916313797237,
+ "epoch": 5.074719800747198,
+ "grad_norm": 0.6934391856193542,
+ "learning_rate": 0.00012997457388105022,
+ "loss": 0.1439570426940918,
+ "mean_token_accuracy": 0.9528236843645572,
+ "num_tokens": 4763269.0,
+ "step": 2040
+ },
+ {
+ "epoch": 5.074719800747198,
+ "eval_entropy": 0.3570949243771475,
+ "eval_loss": 0.6465504169464111,
+ "eval_mean_token_accuracy": 0.8490785547467166,
+ "eval_num_tokens": 4763269.0,
+ "eval_runtime": 85.9574,
+ "eval_samples_per_second": 15.996,
+ "eval_steps_per_second": 2.001,
+ "step": 2040
+ },
+ {
+ "entropy": 0.20838565267622472,
+ "epoch": 5.12453300124533,
+ "grad_norm": 0.7286986112594604,
+ "learning_rate": 0.00012802916937942972,
+ "loss": 0.14467307329177856,
+ "mean_token_accuracy": 0.950994835793972,
+ "num_tokens": 4809047.0,
+ "step": 2060
+ },
+ {
+ "epoch": 5.12453300124533,
+ "eval_entropy": 0.3452463157821533,
+ "eval_loss": 0.6705958843231201,
+ "eval_mean_token_accuracy": 0.8490352796953778,
+ "eval_num_tokens": 4809047.0,
+ "eval_runtime": 86.228,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 2060
+ },
+ {
+ "entropy": 0.20453082229942082,
+ "epoch": 5.174346201743462,
+ "grad_norm": 0.7515555620193481,
+ "learning_rate": 0.00012607927442550974,
+ "loss": 0.13732000589370727,
+ "mean_token_accuracy": 0.9537357829511166,
+ "num_tokens": 4857965.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.174346201743462,
+ "eval_entropy": 0.32431264914745506,
+ "eval_loss": 0.6743043065071106,
+ "eval_mean_token_accuracy": 0.8504878629085629,
+ "eval_num_tokens": 4857965.0,
+ "eval_runtime": 86.5948,
+ "eval_samples_per_second": 15.879,
+ "eval_steps_per_second": 1.986,
+ "step": 2080
+ },
+ {
+ "entropy": 0.21812320686876774,
+ "epoch": 5.224159402241594,
+ "grad_norm": 0.9093465209007263,
+ "learning_rate": 0.0001241254770810132,
+ "loss": 0.14311420917510986,
+ "mean_token_accuracy": 0.9514068141579628,
+ "num_tokens": 4905151.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.224159402241594,
+ "eval_entropy": 0.33086285835435225,
+ "eval_loss": 0.6676449179649353,
+ "eval_mean_token_accuracy": 0.8505287662495015,
+ "eval_num_tokens": 4905151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 2100
+ },
+ {
+ "entropy": 0.2180163251236081,
+ "epoch": 5.273972602739726,
+ "grad_norm": 0.6703007221221924,
+ "learning_rate": 0.00012216836658457075,
+ "loss": 0.14803968667984008,
+ "mean_token_accuracy": 0.9521303348243236,
+ "num_tokens": 4947072.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.273972602739726,
+ "eval_entropy": 0.33162341708707255,
+ "eval_loss": 0.6658875942230225,
+ "eval_mean_token_accuracy": 0.8500757605530495,
+ "eval_num_tokens": 4947072.0,
+ "eval_runtime": 86.6296,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 2120
+ },
+ {
+ "entropy": 0.22511130161583423,
+ "epoch": 5.323785803237858,
+ "grad_norm": 0.8078880906105042,
+ "learning_rate": 0.00012020853317401455,
+ "loss": 0.15228408575057983,
+ "mean_token_accuracy": 0.947144789993763,
+ "num_tokens": 4991974.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.323785803237858,
+ "eval_entropy": 0.3354601170434508,
+ "eval_loss": 0.6677829623222351,
+ "eval_mean_token_accuracy": 0.8482600024273229,
+ "eval_num_tokens": 4991974.0,
+ "eval_runtime": 86.4689,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.989,
+ "step": 2140
+ },
+ {
+ "entropy": 0.2244176059961319,
+ "epoch": 5.37359900373599,
+ "grad_norm": 0.9636075496673584,
+ "learning_rate": 0.00011824656790837037,
+ "loss": 0.15260883569717407,
+ "mean_token_accuracy": 0.9471467643976211,
+ "num_tokens": 5038400.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.37359900373599,
+ "eval_entropy": 0.3381616926297199,
+ "eval_loss": 0.6694412231445312,
+ "eval_mean_token_accuracy": 0.8482369603805764,
+ "eval_num_tokens": 5038400.0,
+ "eval_runtime": 86.4147,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 2160
+ },
+ {
+ "entropy": 0.22982364390045404,
+ "epoch": 5.423412204234122,
+ "grad_norm": 0.775401771068573,
+ "learning_rate": 0.00011628306248960262,
+ "loss": 0.15140302181243898,
+ "mean_token_accuracy": 0.9492553934454918,
+ "num_tokens": 5083166.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.423412204234122,
+ "eval_entropy": 0.3305150235808173,
+ "eval_loss": 0.6717822551727295,
+ "eval_mean_token_accuracy": 0.8489849723355715,
+ "eval_num_tokens": 5083166.0,
+ "eval_runtime": 86.4728,
+ "eval_samples_per_second": 15.901,
+ "eval_steps_per_second": 1.989,
+ "step": 2180
+ },
+ {
+ "entropy": 0.21448935717344284,
+ "epoch": 5.473225404732254,
+ "grad_norm": 0.6575281023979187,
+ "learning_rate": 0.00011431860908416465,
+ "loss": 0.1452319622039795,
+ "mean_token_accuracy": 0.9505287684500218,
+ "num_tokens": 5135109.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.473225404732254,
+ "eval_entropy": 0.3488145174328671,
+ "eval_loss": 0.6612305641174316,
+ "eval_mean_token_accuracy": 0.8492907808963642,
+ "eval_num_tokens": 5135109.0,
+ "eval_runtime": 86.6927,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 2200
+ },
+ {
+ "entropy": 0.23091202937066554,
+ "epoch": 5.523038605230386,
+ "grad_norm": 0.8909686207771301,
+ "learning_rate": 0.00011235380014440985,
+ "loss": 0.15150139331817628,
+ "mean_token_accuracy": 0.9497875183820724,
+ "num_tokens": 5180138.0,
+ "step": 2220
+ },
+ {
+ "epoch": 5.523038605230386,
+ "eval_entropy": 0.3268539015810157,
+ "eval_loss": 0.6667542457580566,
+ "eval_mean_token_accuracy": 0.8499062903398691,
+ "eval_num_tokens": 5180138.0,
+ "eval_runtime": 86.4644,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 2220
+ },
+ {
+ "entropy": 0.2227974807843566,
+ "epoch": 5.572851805728518,
+ "grad_norm": 0.6180275082588196,
+ "learning_rate": 0.0001103892282299158,
+ "loss": 0.1491069197654724,
+ "mean_token_accuracy": 0.9488144010305405,
+ "num_tokens": 5226864.0,
+ "step": 2240
+ },
+ {
+ "epoch": 5.572851805728518,
+ "eval_entropy": 0.3346347655494546,
+ "eval_loss": 0.6665948629379272,
+ "eval_mean_token_accuracy": 0.8499961893918903,
+ "eval_num_tokens": 5226864.0,
+ "eval_runtime": 87.0548,
+ "eval_samples_per_second": 15.795,
+ "eval_steps_per_second": 1.976,
+ "step": 2240
+ },
+ {
+ "entropy": 0.21368421968072654,
+ "epoch": 5.62266500622665,
+ "grad_norm": 0.6004369258880615,
+ "learning_rate": 0.00010842548582877651,
+ "loss": 0.14485255479812623,
+ "mean_token_accuracy": 0.9502056457102299,
+ "num_tokens": 5276602.0,
+ "step": 2260
+ },
+ {
+ "epoch": 5.62266500622665,
+ "eval_entropy": 0.32753298804163933,
+ "eval_loss": 0.6680151224136353,
+ "eval_mean_token_accuracy": 0.8515451086121936,
+ "eval_num_tokens": 5276602.0,
+ "eval_runtime": 86.8524,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.98,
+ "step": 2260
+ },
+ {
+ "entropy": 0.2103635374456644,
+ "epoch": 5.672478206724782,
+ "grad_norm": 0.699174702167511,
+ "learning_rate": 0.00010646316517891613,
+ "loss": 0.14297772645950318,
+ "mean_token_accuracy": 0.9512537539005279,
+ "num_tokens": 5323718.0,
+ "step": 2280
+ },
+ {
+ "epoch": 5.672478206724782,
+ "eval_entropy": 0.32966585959806,
+ "eval_loss": 0.675578773021698,
+ "eval_mean_token_accuracy": 0.8509623023659684,
+ "eval_num_tokens": 5323718.0,
+ "eval_runtime": 86.4518,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2280
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.2491624057244877e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2300/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2300/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2300/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2300/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2300/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2300/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2300/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2300/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2300/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2300/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2300/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2300/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2300/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2300/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..c59e30a24a6bc9c0ce97f8bf5b4b58471eb6a174
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2300/trainer_state.json
@@ -0,0 +1,2449 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 5.722291407222914,
+ "eval_steps": 20,
+ "global_step": 2300,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ },
+ {
+ "entropy": 0.3193941755220294,
+ "epoch": 4.5280199252802,
+ "grad_norm": 0.8281906843185425,
+ "learning_rate": 0.0001509111761786888,
+ "loss": 0.23936262130737304,
+ "mean_token_accuracy": 0.9201708927750587,
+ "num_tokens": 4244423.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.5280199252802,
+ "eval_entropy": 0.38704028864239537,
+ "eval_loss": 0.6006569266319275,
+ "eval_mean_token_accuracy": 0.8502406720505205,
+ "eval_num_tokens": 4244423.0,
+ "eval_runtime": 86.8059,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1820
+ },
+ {
+ "entropy": 0.3164879363030195,
+ "epoch": 4.577833125778331,
+ "grad_norm": 0.7892968654632568,
+ "learning_rate": 0.00014905346557909867,
+ "loss": 0.24541733264923096,
+ "mean_token_accuracy": 0.9175932116806507,
+ "num_tokens": 4289773.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.577833125778331,
+ "eval_entropy": 0.38861122120951497,
+ "eval_loss": 0.6115967631340027,
+ "eval_mean_token_accuracy": 0.849471275196519,
+ "eval_num_tokens": 4289773.0,
+ "eval_runtime": 86.2946,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1840
+ },
+ {
+ "entropy": 0.3051785985007882,
+ "epoch": 4.627646326276463,
+ "grad_norm": 0.8109654188156128,
+ "learning_rate": 0.0001471849238862319,
+ "loss": 0.23433220386505127,
+ "mean_token_accuracy": 0.9206570319831371,
+ "num_tokens": 4336894.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.627646326276463,
+ "eval_entropy": 0.37162452295076015,
+ "eval_loss": 0.6184061765670776,
+ "eval_mean_token_accuracy": 0.8501173268223918,
+ "eval_num_tokens": 4336894.0,
+ "eval_runtime": 86.6865,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1860
+ },
+ {
+ "entropy": 0.3168198253959417,
+ "epoch": 4.677459526774595,
+ "grad_norm": 0.9512342214584351,
+ "learning_rate": 0.0001453061146267775,
+ "loss": 0.23832404613494873,
+ "mean_token_accuracy": 0.9197044663131237,
+ "num_tokens": 4382947.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.677459526774595,
+ "eval_entropy": 0.3845940856912801,
+ "eval_loss": 0.606762707233429,
+ "eval_mean_token_accuracy": 0.8504838194957999,
+ "eval_num_tokens": 4382947.0,
+ "eval_runtime": 86.5175,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 1880
+ },
+ {
+ "entropy": 0.30791807882487776,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 0.8123113512992859,
+ "learning_rate": 0.00014341760442398248,
+ "loss": 0.2395785331726074,
+ "mean_token_accuracy": 0.918928150832653,
+ "num_tokens": 4433050.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.7272727272727275,
+ "eval_entropy": 0.39762327222283494,
+ "eval_loss": 0.5994202494621277,
+ "eval_mean_token_accuracy": 0.8509274201337681,
+ "eval_num_tokens": 4433050.0,
+ "eval_runtime": 86.2873,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.993,
+ "step": 1900
+ },
+ {
+ "entropy": 0.3021434534341097,
+ "epoch": 4.777085927770859,
+ "grad_norm": 0.731787383556366,
+ "learning_rate": 0.000141519962826766,
+ "loss": 0.23494718074798585,
+ "mean_token_accuracy": 0.9201403826475143,
+ "num_tokens": 4483598.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.777085927770859,
+ "eval_entropy": 0.3827026732439219,
+ "eval_loss": 0.5995895862579346,
+ "eval_mean_token_accuracy": 0.851468373523202,
+ "eval_num_tokens": 4483598.0,
+ "eval_runtime": 86.3006,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 1920
+ },
+ {
+ "entropy": 0.31626159623265265,
+ "epoch": 4.826899128268991,
+ "grad_norm": 0.8848487138748169,
+ "learning_rate": 0.00013961376213795132,
+ "loss": 0.2439030647277832,
+ "mean_token_accuracy": 0.9196575872600079,
+ "num_tokens": 4529201.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.826899128268991,
+ "eval_entropy": 0.388698436839636,
+ "eval_loss": 0.6000174283981323,
+ "eval_mean_token_accuracy": 0.8518068187458571,
+ "eval_num_tokens": 4529201.0,
+ "eval_runtime": 86.8979,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.979,
+ "step": 1940
+ },
+ {
+ "entropy": 0.30520407035946845,
+ "epoch": 4.876712328767123,
+ "grad_norm": 0.8532460927963257,
+ "learning_rate": 0.00013769957724166695,
+ "loss": 0.23458616733551024,
+ "mean_token_accuracy": 0.9221912942826748,
+ "num_tokens": 4578167.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.876712328767123,
+ "eval_entropy": 0.38777847102908203,
+ "eval_loss": 0.6004981398582458,
+ "eval_mean_token_accuracy": 0.8516481768253238,
+ "eval_num_tokens": 4578167.0,
+ "eval_runtime": 87.0777,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.975,
+ "step": 1960
+ },
+ {
+ "entropy": 0.3226448342204094,
+ "epoch": 4.926525529265255,
+ "grad_norm": 0.6945561766624451,
+ "learning_rate": 0.0001357779854299694,
+ "loss": 0.24048397541046143,
+ "mean_token_accuracy": 0.9195300146937371,
+ "num_tokens": 4622316.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.926525529265255,
+ "eval_entropy": 0.38581624263247777,
+ "eval_loss": 0.6029234528541565,
+ "eval_mean_token_accuracy": 0.8514213260523108,
+ "eval_num_tokens": 4622316.0,
+ "eval_runtime": 85.8729,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 1980
+ },
+ {
+ "entropy": 0.3051655298098922,
+ "epoch": 4.976338729763388,
+ "grad_norm": 0.7976452708244324,
+ "learning_rate": 0.00013384956622874001,
+ "loss": 0.23584742546081544,
+ "mean_token_accuracy": 0.9216851457953453,
+ "num_tokens": 4670746.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.976338729763388,
+ "eval_entropy": 0.37913159246361533,
+ "eval_loss": 0.6057604551315308,
+ "eval_mean_token_accuracy": 0.8525801203971686,
+ "eval_num_tokens": 4670746.0,
+ "eval_runtime": 86.1145,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2000
+ },
+ {
+ "entropy": 0.27438195240803254,
+ "epoch": 5.024906600249066,
+ "grad_norm": 0.6729586124420166,
+ "learning_rate": 0.0001319149012229075,
+ "loss": 0.19775952100753785,
+ "mean_token_accuracy": 0.9339428559327737,
+ "num_tokens": 4716176.0,
+ "step": 2020
+ },
+ {
+ "epoch": 5.024906600249066,
+ "eval_entropy": 0.3448961910813354,
+ "eval_loss": 0.6750120520591736,
+ "eval_mean_token_accuracy": 0.8487970232963562,
+ "eval_num_tokens": 4716176.0,
+ "eval_runtime": 86.1169,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2020
+ },
+ {
+ "entropy": 0.21423916313797237,
+ "epoch": 5.074719800747198,
+ "grad_norm": 0.6934391856193542,
+ "learning_rate": 0.00012997457388105022,
+ "loss": 0.1439570426940918,
+ "mean_token_accuracy": 0.9528236843645572,
+ "num_tokens": 4763269.0,
+ "step": 2040
+ },
+ {
+ "epoch": 5.074719800747198,
+ "eval_entropy": 0.3570949243771475,
+ "eval_loss": 0.6465504169464111,
+ "eval_mean_token_accuracy": 0.8490785547467166,
+ "eval_num_tokens": 4763269.0,
+ "eval_runtime": 85.9574,
+ "eval_samples_per_second": 15.996,
+ "eval_steps_per_second": 2.001,
+ "step": 2040
+ },
+ {
+ "entropy": 0.20838565267622472,
+ "epoch": 5.12453300124533,
+ "grad_norm": 0.7286986112594604,
+ "learning_rate": 0.00012802916937942972,
+ "loss": 0.14467307329177856,
+ "mean_token_accuracy": 0.950994835793972,
+ "num_tokens": 4809047.0,
+ "step": 2060
+ },
+ {
+ "epoch": 5.12453300124533,
+ "eval_entropy": 0.3452463157821533,
+ "eval_loss": 0.6705958843231201,
+ "eval_mean_token_accuracy": 0.8490352796953778,
+ "eval_num_tokens": 4809047.0,
+ "eval_runtime": 86.228,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 2060
+ },
+ {
+ "entropy": 0.20453082229942082,
+ "epoch": 5.174346201743462,
+ "grad_norm": 0.7515555620193481,
+ "learning_rate": 0.00012607927442550974,
+ "loss": 0.13732000589370727,
+ "mean_token_accuracy": 0.9537357829511166,
+ "num_tokens": 4857965.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.174346201743462,
+ "eval_entropy": 0.32431264914745506,
+ "eval_loss": 0.6743043065071106,
+ "eval_mean_token_accuracy": 0.8504878629085629,
+ "eval_num_tokens": 4857965.0,
+ "eval_runtime": 86.5948,
+ "eval_samples_per_second": 15.879,
+ "eval_steps_per_second": 1.986,
+ "step": 2080
+ },
+ {
+ "entropy": 0.21812320686876774,
+ "epoch": 5.224159402241594,
+ "grad_norm": 0.9093465209007263,
+ "learning_rate": 0.0001241254770810132,
+ "loss": 0.14311420917510986,
+ "mean_token_accuracy": 0.9514068141579628,
+ "num_tokens": 4905151.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.224159402241594,
+ "eval_entropy": 0.33086285835435225,
+ "eval_loss": 0.6676449179649353,
+ "eval_mean_token_accuracy": 0.8505287662495015,
+ "eval_num_tokens": 4905151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 2100
+ },
+ {
+ "entropy": 0.2180163251236081,
+ "epoch": 5.273972602739726,
+ "grad_norm": 0.6703007221221924,
+ "learning_rate": 0.00012216836658457075,
+ "loss": 0.14803968667984008,
+ "mean_token_accuracy": 0.9521303348243236,
+ "num_tokens": 4947072.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.273972602739726,
+ "eval_entropy": 0.33162341708707255,
+ "eval_loss": 0.6658875942230225,
+ "eval_mean_token_accuracy": 0.8500757605530495,
+ "eval_num_tokens": 4947072.0,
+ "eval_runtime": 86.6296,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 2120
+ },
+ {
+ "entropy": 0.22511130161583423,
+ "epoch": 5.323785803237858,
+ "grad_norm": 0.8078880906105042,
+ "learning_rate": 0.00012020853317401455,
+ "loss": 0.15228408575057983,
+ "mean_token_accuracy": 0.947144789993763,
+ "num_tokens": 4991974.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.323785803237858,
+ "eval_entropy": 0.3354601170434508,
+ "eval_loss": 0.6677829623222351,
+ "eval_mean_token_accuracy": 0.8482600024273229,
+ "eval_num_tokens": 4991974.0,
+ "eval_runtime": 86.4689,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.989,
+ "step": 2140
+ },
+ {
+ "entropy": 0.2244176059961319,
+ "epoch": 5.37359900373599,
+ "grad_norm": 0.9636075496673584,
+ "learning_rate": 0.00011824656790837037,
+ "loss": 0.15260883569717407,
+ "mean_token_accuracy": 0.9471467643976211,
+ "num_tokens": 5038400.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.37359900373599,
+ "eval_entropy": 0.3381616926297199,
+ "eval_loss": 0.6694412231445312,
+ "eval_mean_token_accuracy": 0.8482369603805764,
+ "eval_num_tokens": 5038400.0,
+ "eval_runtime": 86.4147,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 2160
+ },
+ {
+ "entropy": 0.22982364390045404,
+ "epoch": 5.423412204234122,
+ "grad_norm": 0.775401771068573,
+ "learning_rate": 0.00011628306248960262,
+ "loss": 0.15140302181243898,
+ "mean_token_accuracy": 0.9492553934454918,
+ "num_tokens": 5083166.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.423412204234122,
+ "eval_entropy": 0.3305150235808173,
+ "eval_loss": 0.6717822551727295,
+ "eval_mean_token_accuracy": 0.8489849723355715,
+ "eval_num_tokens": 5083166.0,
+ "eval_runtime": 86.4728,
+ "eval_samples_per_second": 15.901,
+ "eval_steps_per_second": 1.989,
+ "step": 2180
+ },
+ {
+ "entropy": 0.21448935717344284,
+ "epoch": 5.473225404732254,
+ "grad_norm": 0.6575281023979187,
+ "learning_rate": 0.00011431860908416465,
+ "loss": 0.1452319622039795,
+ "mean_token_accuracy": 0.9505287684500218,
+ "num_tokens": 5135109.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.473225404732254,
+ "eval_entropy": 0.3488145174328671,
+ "eval_loss": 0.6612305641174316,
+ "eval_mean_token_accuracy": 0.8492907808963642,
+ "eval_num_tokens": 5135109.0,
+ "eval_runtime": 86.6927,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 2200
+ },
+ {
+ "entropy": 0.23091202937066554,
+ "epoch": 5.523038605230386,
+ "grad_norm": 0.8909686207771301,
+ "learning_rate": 0.00011235380014440985,
+ "loss": 0.15150139331817628,
+ "mean_token_accuracy": 0.9497875183820724,
+ "num_tokens": 5180138.0,
+ "step": 2220
+ },
+ {
+ "epoch": 5.523038605230386,
+ "eval_entropy": 0.3268539015810157,
+ "eval_loss": 0.6667542457580566,
+ "eval_mean_token_accuracy": 0.8499062903398691,
+ "eval_num_tokens": 5180138.0,
+ "eval_runtime": 86.4644,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 2220
+ },
+ {
+ "entropy": 0.2227974807843566,
+ "epoch": 5.572851805728518,
+ "grad_norm": 0.6180275082588196,
+ "learning_rate": 0.0001103892282299158,
+ "loss": 0.1491069197654724,
+ "mean_token_accuracy": 0.9488144010305405,
+ "num_tokens": 5226864.0,
+ "step": 2240
+ },
+ {
+ "epoch": 5.572851805728518,
+ "eval_entropy": 0.3346347655494546,
+ "eval_loss": 0.6665948629379272,
+ "eval_mean_token_accuracy": 0.8499961893918903,
+ "eval_num_tokens": 5226864.0,
+ "eval_runtime": 87.0548,
+ "eval_samples_per_second": 15.795,
+ "eval_steps_per_second": 1.976,
+ "step": 2240
+ },
+ {
+ "entropy": 0.21368421968072654,
+ "epoch": 5.62266500622665,
+ "grad_norm": 0.6004369258880615,
+ "learning_rate": 0.00010842548582877651,
+ "loss": 0.14485255479812623,
+ "mean_token_accuracy": 0.9502056457102299,
+ "num_tokens": 5276602.0,
+ "step": 2260
+ },
+ {
+ "epoch": 5.62266500622665,
+ "eval_entropy": 0.32753298804163933,
+ "eval_loss": 0.6680151224136353,
+ "eval_mean_token_accuracy": 0.8515451086121936,
+ "eval_num_tokens": 5276602.0,
+ "eval_runtime": 86.8524,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.98,
+ "step": 2260
+ },
+ {
+ "entropy": 0.2103635374456644,
+ "epoch": 5.672478206724782,
+ "grad_norm": 0.699174702167511,
+ "learning_rate": 0.00010646316517891613,
+ "loss": 0.14297772645950318,
+ "mean_token_accuracy": 0.9512537539005279,
+ "num_tokens": 5323718.0,
+ "step": 2280
+ },
+ {
+ "epoch": 5.672478206724782,
+ "eval_entropy": 0.32966585959806,
+ "eval_loss": 0.675578773021698,
+ "eval_mean_token_accuracy": 0.8509623023659684,
+ "eval_num_tokens": 5323718.0,
+ "eval_runtime": 86.4518,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2280
+ },
+ {
+ "entropy": 0.22516900151968003,
+ "epoch": 5.722291407222914,
+ "grad_norm": 0.6637354493141174,
+ "learning_rate": 0.00010450285808947797,
+ "loss": 0.15202572345733642,
+ "mean_token_accuracy": 0.9482452072203159,
+ "num_tokens": 5369039.0,
+ "step": 2300
+ },
+ {
+ "epoch": 5.722291407222914,
+ "eval_entropy": 0.3369456917740578,
+ "eval_loss": 0.6697061061859131,
+ "eval_mean_token_accuracy": 0.848603522361711,
+ "eval_num_tokens": 5369039.0,
+ "eval_runtime": 86.6371,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.985,
+ "step": 2300
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.268772758425764e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2320/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2320/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2320/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2320/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2320/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2320/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2320/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2320/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2320/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2320/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2320/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2320/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2320/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2320/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..23deef10ffd3e6e1491d8d220f0b7e80fe2b4b2b
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2320/trainer_state.json
@@ -0,0 +1,2470 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 5.772104607721046,
+ "eval_steps": 20,
+ "global_step": 2320,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ },
+ {
+ "entropy": 0.3193941755220294,
+ "epoch": 4.5280199252802,
+ "grad_norm": 0.8281906843185425,
+ "learning_rate": 0.0001509111761786888,
+ "loss": 0.23936262130737304,
+ "mean_token_accuracy": 0.9201708927750587,
+ "num_tokens": 4244423.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.5280199252802,
+ "eval_entropy": 0.38704028864239537,
+ "eval_loss": 0.6006569266319275,
+ "eval_mean_token_accuracy": 0.8502406720505205,
+ "eval_num_tokens": 4244423.0,
+ "eval_runtime": 86.8059,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1820
+ },
+ {
+ "entropy": 0.3164879363030195,
+ "epoch": 4.577833125778331,
+ "grad_norm": 0.7892968654632568,
+ "learning_rate": 0.00014905346557909867,
+ "loss": 0.24541733264923096,
+ "mean_token_accuracy": 0.9175932116806507,
+ "num_tokens": 4289773.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.577833125778331,
+ "eval_entropy": 0.38861122120951497,
+ "eval_loss": 0.6115967631340027,
+ "eval_mean_token_accuracy": 0.849471275196519,
+ "eval_num_tokens": 4289773.0,
+ "eval_runtime": 86.2946,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1840
+ },
+ {
+ "entropy": 0.3051785985007882,
+ "epoch": 4.627646326276463,
+ "grad_norm": 0.8109654188156128,
+ "learning_rate": 0.0001471849238862319,
+ "loss": 0.23433220386505127,
+ "mean_token_accuracy": 0.9206570319831371,
+ "num_tokens": 4336894.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.627646326276463,
+ "eval_entropy": 0.37162452295076015,
+ "eval_loss": 0.6184061765670776,
+ "eval_mean_token_accuracy": 0.8501173268223918,
+ "eval_num_tokens": 4336894.0,
+ "eval_runtime": 86.6865,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1860
+ },
+ {
+ "entropy": 0.3168198253959417,
+ "epoch": 4.677459526774595,
+ "grad_norm": 0.9512342214584351,
+ "learning_rate": 0.0001453061146267775,
+ "loss": 0.23832404613494873,
+ "mean_token_accuracy": 0.9197044663131237,
+ "num_tokens": 4382947.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.677459526774595,
+ "eval_entropy": 0.3845940856912801,
+ "eval_loss": 0.606762707233429,
+ "eval_mean_token_accuracy": 0.8504838194957999,
+ "eval_num_tokens": 4382947.0,
+ "eval_runtime": 86.5175,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 1880
+ },
+ {
+ "entropy": 0.30791807882487776,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 0.8123113512992859,
+ "learning_rate": 0.00014341760442398248,
+ "loss": 0.2395785331726074,
+ "mean_token_accuracy": 0.918928150832653,
+ "num_tokens": 4433050.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.7272727272727275,
+ "eval_entropy": 0.39762327222283494,
+ "eval_loss": 0.5994202494621277,
+ "eval_mean_token_accuracy": 0.8509274201337681,
+ "eval_num_tokens": 4433050.0,
+ "eval_runtime": 86.2873,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.993,
+ "step": 1900
+ },
+ {
+ "entropy": 0.3021434534341097,
+ "epoch": 4.777085927770859,
+ "grad_norm": 0.731787383556366,
+ "learning_rate": 0.000141519962826766,
+ "loss": 0.23494718074798585,
+ "mean_token_accuracy": 0.9201403826475143,
+ "num_tokens": 4483598.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.777085927770859,
+ "eval_entropy": 0.3827026732439219,
+ "eval_loss": 0.5995895862579346,
+ "eval_mean_token_accuracy": 0.851468373523202,
+ "eval_num_tokens": 4483598.0,
+ "eval_runtime": 86.3006,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 1920
+ },
+ {
+ "entropy": 0.31626159623265265,
+ "epoch": 4.826899128268991,
+ "grad_norm": 0.8848487138748169,
+ "learning_rate": 0.00013961376213795132,
+ "loss": 0.2439030647277832,
+ "mean_token_accuracy": 0.9196575872600079,
+ "num_tokens": 4529201.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.826899128268991,
+ "eval_entropy": 0.388698436839636,
+ "eval_loss": 0.6000174283981323,
+ "eval_mean_token_accuracy": 0.8518068187458571,
+ "eval_num_tokens": 4529201.0,
+ "eval_runtime": 86.8979,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.979,
+ "step": 1940
+ },
+ {
+ "entropy": 0.30520407035946845,
+ "epoch": 4.876712328767123,
+ "grad_norm": 0.8532460927963257,
+ "learning_rate": 0.00013769957724166695,
+ "loss": 0.23458616733551024,
+ "mean_token_accuracy": 0.9221912942826748,
+ "num_tokens": 4578167.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.876712328767123,
+ "eval_entropy": 0.38777847102908203,
+ "eval_loss": 0.6004981398582458,
+ "eval_mean_token_accuracy": 0.8516481768253238,
+ "eval_num_tokens": 4578167.0,
+ "eval_runtime": 87.0777,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.975,
+ "step": 1960
+ },
+ {
+ "entropy": 0.3226448342204094,
+ "epoch": 4.926525529265255,
+ "grad_norm": 0.6945561766624451,
+ "learning_rate": 0.0001357779854299694,
+ "loss": 0.24048397541046143,
+ "mean_token_accuracy": 0.9195300146937371,
+ "num_tokens": 4622316.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.926525529265255,
+ "eval_entropy": 0.38581624263247777,
+ "eval_loss": 0.6029234528541565,
+ "eval_mean_token_accuracy": 0.8514213260523108,
+ "eval_num_tokens": 4622316.0,
+ "eval_runtime": 85.8729,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 1980
+ },
+ {
+ "entropy": 0.3051655298098922,
+ "epoch": 4.976338729763388,
+ "grad_norm": 0.7976452708244324,
+ "learning_rate": 0.00013384956622874001,
+ "loss": 0.23584742546081544,
+ "mean_token_accuracy": 0.9216851457953453,
+ "num_tokens": 4670746.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.976338729763388,
+ "eval_entropy": 0.37913159246361533,
+ "eval_loss": 0.6057604551315308,
+ "eval_mean_token_accuracy": 0.8525801203971686,
+ "eval_num_tokens": 4670746.0,
+ "eval_runtime": 86.1145,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2000
+ },
+ {
+ "entropy": 0.27438195240803254,
+ "epoch": 5.024906600249066,
+ "grad_norm": 0.6729586124420166,
+ "learning_rate": 0.0001319149012229075,
+ "loss": 0.19775952100753785,
+ "mean_token_accuracy": 0.9339428559327737,
+ "num_tokens": 4716176.0,
+ "step": 2020
+ },
+ {
+ "epoch": 5.024906600249066,
+ "eval_entropy": 0.3448961910813354,
+ "eval_loss": 0.6750120520591736,
+ "eval_mean_token_accuracy": 0.8487970232963562,
+ "eval_num_tokens": 4716176.0,
+ "eval_runtime": 86.1169,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2020
+ },
+ {
+ "entropy": 0.21423916313797237,
+ "epoch": 5.074719800747198,
+ "grad_norm": 0.6934391856193542,
+ "learning_rate": 0.00012997457388105022,
+ "loss": 0.1439570426940918,
+ "mean_token_accuracy": 0.9528236843645572,
+ "num_tokens": 4763269.0,
+ "step": 2040
+ },
+ {
+ "epoch": 5.074719800747198,
+ "eval_entropy": 0.3570949243771475,
+ "eval_loss": 0.6465504169464111,
+ "eval_mean_token_accuracy": 0.8490785547467166,
+ "eval_num_tokens": 4763269.0,
+ "eval_runtime": 85.9574,
+ "eval_samples_per_second": 15.996,
+ "eval_steps_per_second": 2.001,
+ "step": 2040
+ },
+ {
+ "entropy": 0.20838565267622472,
+ "epoch": 5.12453300124533,
+ "grad_norm": 0.7286986112594604,
+ "learning_rate": 0.00012802916937942972,
+ "loss": 0.14467307329177856,
+ "mean_token_accuracy": 0.950994835793972,
+ "num_tokens": 4809047.0,
+ "step": 2060
+ },
+ {
+ "epoch": 5.12453300124533,
+ "eval_entropy": 0.3452463157821533,
+ "eval_loss": 0.6705958843231201,
+ "eval_mean_token_accuracy": 0.8490352796953778,
+ "eval_num_tokens": 4809047.0,
+ "eval_runtime": 86.228,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 2060
+ },
+ {
+ "entropy": 0.20453082229942082,
+ "epoch": 5.174346201743462,
+ "grad_norm": 0.7515555620193481,
+ "learning_rate": 0.00012607927442550974,
+ "loss": 0.13732000589370727,
+ "mean_token_accuracy": 0.9537357829511166,
+ "num_tokens": 4857965.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.174346201743462,
+ "eval_entropy": 0.32431264914745506,
+ "eval_loss": 0.6743043065071106,
+ "eval_mean_token_accuracy": 0.8504878629085629,
+ "eval_num_tokens": 4857965.0,
+ "eval_runtime": 86.5948,
+ "eval_samples_per_second": 15.879,
+ "eval_steps_per_second": 1.986,
+ "step": 2080
+ },
+ {
+ "entropy": 0.21812320686876774,
+ "epoch": 5.224159402241594,
+ "grad_norm": 0.9093465209007263,
+ "learning_rate": 0.0001241254770810132,
+ "loss": 0.14311420917510986,
+ "mean_token_accuracy": 0.9514068141579628,
+ "num_tokens": 4905151.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.224159402241594,
+ "eval_entropy": 0.33086285835435225,
+ "eval_loss": 0.6676449179649353,
+ "eval_mean_token_accuracy": 0.8505287662495015,
+ "eval_num_tokens": 4905151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 2100
+ },
+ {
+ "entropy": 0.2180163251236081,
+ "epoch": 5.273972602739726,
+ "grad_norm": 0.6703007221221924,
+ "learning_rate": 0.00012216836658457075,
+ "loss": 0.14803968667984008,
+ "mean_token_accuracy": 0.9521303348243236,
+ "num_tokens": 4947072.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.273972602739726,
+ "eval_entropy": 0.33162341708707255,
+ "eval_loss": 0.6658875942230225,
+ "eval_mean_token_accuracy": 0.8500757605530495,
+ "eval_num_tokens": 4947072.0,
+ "eval_runtime": 86.6296,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 2120
+ },
+ {
+ "entropy": 0.22511130161583423,
+ "epoch": 5.323785803237858,
+ "grad_norm": 0.8078880906105042,
+ "learning_rate": 0.00012020853317401455,
+ "loss": 0.15228408575057983,
+ "mean_token_accuracy": 0.947144789993763,
+ "num_tokens": 4991974.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.323785803237858,
+ "eval_entropy": 0.3354601170434508,
+ "eval_loss": 0.6677829623222351,
+ "eval_mean_token_accuracy": 0.8482600024273229,
+ "eval_num_tokens": 4991974.0,
+ "eval_runtime": 86.4689,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.989,
+ "step": 2140
+ },
+ {
+ "entropy": 0.2244176059961319,
+ "epoch": 5.37359900373599,
+ "grad_norm": 0.9636075496673584,
+ "learning_rate": 0.00011824656790837037,
+ "loss": 0.15260883569717407,
+ "mean_token_accuracy": 0.9471467643976211,
+ "num_tokens": 5038400.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.37359900373599,
+ "eval_entropy": 0.3381616926297199,
+ "eval_loss": 0.6694412231445312,
+ "eval_mean_token_accuracy": 0.8482369603805764,
+ "eval_num_tokens": 5038400.0,
+ "eval_runtime": 86.4147,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 2160
+ },
+ {
+ "entropy": 0.22982364390045404,
+ "epoch": 5.423412204234122,
+ "grad_norm": 0.775401771068573,
+ "learning_rate": 0.00011628306248960262,
+ "loss": 0.15140302181243898,
+ "mean_token_accuracy": 0.9492553934454918,
+ "num_tokens": 5083166.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.423412204234122,
+ "eval_entropy": 0.3305150235808173,
+ "eval_loss": 0.6717822551727295,
+ "eval_mean_token_accuracy": 0.8489849723355715,
+ "eval_num_tokens": 5083166.0,
+ "eval_runtime": 86.4728,
+ "eval_samples_per_second": 15.901,
+ "eval_steps_per_second": 1.989,
+ "step": 2180
+ },
+ {
+ "entropy": 0.21448935717344284,
+ "epoch": 5.473225404732254,
+ "grad_norm": 0.6575281023979187,
+ "learning_rate": 0.00011431860908416465,
+ "loss": 0.1452319622039795,
+ "mean_token_accuracy": 0.9505287684500218,
+ "num_tokens": 5135109.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.473225404732254,
+ "eval_entropy": 0.3488145174328671,
+ "eval_loss": 0.6612305641174316,
+ "eval_mean_token_accuracy": 0.8492907808963642,
+ "eval_num_tokens": 5135109.0,
+ "eval_runtime": 86.6927,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 2200
+ },
+ {
+ "entropy": 0.23091202937066554,
+ "epoch": 5.523038605230386,
+ "grad_norm": 0.8909686207771301,
+ "learning_rate": 0.00011235380014440985,
+ "loss": 0.15150139331817628,
+ "mean_token_accuracy": 0.9497875183820724,
+ "num_tokens": 5180138.0,
+ "step": 2220
+ },
+ {
+ "epoch": 5.523038605230386,
+ "eval_entropy": 0.3268539015810157,
+ "eval_loss": 0.6667542457580566,
+ "eval_mean_token_accuracy": 0.8499062903398691,
+ "eval_num_tokens": 5180138.0,
+ "eval_runtime": 86.4644,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 2220
+ },
+ {
+ "entropy": 0.2227974807843566,
+ "epoch": 5.572851805728518,
+ "grad_norm": 0.6180275082588196,
+ "learning_rate": 0.0001103892282299158,
+ "loss": 0.1491069197654724,
+ "mean_token_accuracy": 0.9488144010305405,
+ "num_tokens": 5226864.0,
+ "step": 2240
+ },
+ {
+ "epoch": 5.572851805728518,
+ "eval_entropy": 0.3346347655494546,
+ "eval_loss": 0.6665948629379272,
+ "eval_mean_token_accuracy": 0.8499961893918903,
+ "eval_num_tokens": 5226864.0,
+ "eval_runtime": 87.0548,
+ "eval_samples_per_second": 15.795,
+ "eval_steps_per_second": 1.976,
+ "step": 2240
+ },
+ {
+ "entropy": 0.21368421968072654,
+ "epoch": 5.62266500622665,
+ "grad_norm": 0.6004369258880615,
+ "learning_rate": 0.00010842548582877651,
+ "loss": 0.14485255479812623,
+ "mean_token_accuracy": 0.9502056457102299,
+ "num_tokens": 5276602.0,
+ "step": 2260
+ },
+ {
+ "epoch": 5.62266500622665,
+ "eval_entropy": 0.32753298804163933,
+ "eval_loss": 0.6680151224136353,
+ "eval_mean_token_accuracy": 0.8515451086121936,
+ "eval_num_tokens": 5276602.0,
+ "eval_runtime": 86.8524,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.98,
+ "step": 2260
+ },
+ {
+ "entropy": 0.2103635374456644,
+ "epoch": 5.672478206724782,
+ "grad_norm": 0.699174702167511,
+ "learning_rate": 0.00010646316517891613,
+ "loss": 0.14297772645950318,
+ "mean_token_accuracy": 0.9512537539005279,
+ "num_tokens": 5323718.0,
+ "step": 2280
+ },
+ {
+ "epoch": 5.672478206724782,
+ "eval_entropy": 0.32966585959806,
+ "eval_loss": 0.675578773021698,
+ "eval_mean_token_accuracy": 0.8509623023659684,
+ "eval_num_tokens": 5323718.0,
+ "eval_runtime": 86.4518,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2280
+ },
+ {
+ "entropy": 0.22516900151968003,
+ "epoch": 5.722291407222914,
+ "grad_norm": 0.6637354493141174,
+ "learning_rate": 0.00010450285808947797,
+ "loss": 0.15202572345733642,
+ "mean_token_accuracy": 0.9482452072203159,
+ "num_tokens": 5369039.0,
+ "step": 2300
+ },
+ {
+ "epoch": 5.722291407222914,
+ "eval_entropy": 0.3369456917740578,
+ "eval_loss": 0.6697061061859131,
+ "eval_mean_token_accuracy": 0.848603522361711,
+ "eval_num_tokens": 5369039.0,
+ "eval_runtime": 86.6371,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.985,
+ "step": 2300
+ },
+ {
+ "entropy": 0.21841065725311637,
+ "epoch": 5.772104607721046,
+ "grad_norm": 0.7940268516540527,
+ "learning_rate": 0.00010254515576234297,
+ "loss": 0.14710167646408082,
+ "mean_token_accuracy": 0.9493498183786869,
+ "num_tokens": 5417029.0,
+ "step": 2320
+ },
+ {
+ "epoch": 5.772104607721046,
+ "eval_entropy": 0.3237486180177955,
+ "eval_loss": 0.6779657602310181,
+ "eval_mean_token_accuracy": 0.8500715313955794,
+ "eval_num_tokens": 5417029.0,
+ "eval_runtime": 86.1826,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 1.996,
+ "step": 2320
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.288900117862482e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2340/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2340/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2340/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2340/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2340/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2340/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2340/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2340/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2340/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2340/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2340/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2340/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2340/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2340/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..1aeec0495ebf5185ebf5b95cc853939c8bbdff03
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2340/trainer_state.json
@@ -0,0 +1,2491 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 5.821917808219178,
+ "eval_steps": 20,
+ "global_step": 2340,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ },
+ {
+ "entropy": 0.3193941755220294,
+ "epoch": 4.5280199252802,
+ "grad_norm": 0.8281906843185425,
+ "learning_rate": 0.0001509111761786888,
+ "loss": 0.23936262130737304,
+ "mean_token_accuracy": 0.9201708927750587,
+ "num_tokens": 4244423.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.5280199252802,
+ "eval_entropy": 0.38704028864239537,
+ "eval_loss": 0.6006569266319275,
+ "eval_mean_token_accuracy": 0.8502406720505205,
+ "eval_num_tokens": 4244423.0,
+ "eval_runtime": 86.8059,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1820
+ },
+ {
+ "entropy": 0.3164879363030195,
+ "epoch": 4.577833125778331,
+ "grad_norm": 0.7892968654632568,
+ "learning_rate": 0.00014905346557909867,
+ "loss": 0.24541733264923096,
+ "mean_token_accuracy": 0.9175932116806507,
+ "num_tokens": 4289773.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.577833125778331,
+ "eval_entropy": 0.38861122120951497,
+ "eval_loss": 0.6115967631340027,
+ "eval_mean_token_accuracy": 0.849471275196519,
+ "eval_num_tokens": 4289773.0,
+ "eval_runtime": 86.2946,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1840
+ },
+ {
+ "entropy": 0.3051785985007882,
+ "epoch": 4.627646326276463,
+ "grad_norm": 0.8109654188156128,
+ "learning_rate": 0.0001471849238862319,
+ "loss": 0.23433220386505127,
+ "mean_token_accuracy": 0.9206570319831371,
+ "num_tokens": 4336894.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.627646326276463,
+ "eval_entropy": 0.37162452295076015,
+ "eval_loss": 0.6184061765670776,
+ "eval_mean_token_accuracy": 0.8501173268223918,
+ "eval_num_tokens": 4336894.0,
+ "eval_runtime": 86.6865,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1860
+ },
+ {
+ "entropy": 0.3168198253959417,
+ "epoch": 4.677459526774595,
+ "grad_norm": 0.9512342214584351,
+ "learning_rate": 0.0001453061146267775,
+ "loss": 0.23832404613494873,
+ "mean_token_accuracy": 0.9197044663131237,
+ "num_tokens": 4382947.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.677459526774595,
+ "eval_entropy": 0.3845940856912801,
+ "eval_loss": 0.606762707233429,
+ "eval_mean_token_accuracy": 0.8504838194957999,
+ "eval_num_tokens": 4382947.0,
+ "eval_runtime": 86.5175,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 1880
+ },
+ {
+ "entropy": 0.30791807882487776,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 0.8123113512992859,
+ "learning_rate": 0.00014341760442398248,
+ "loss": 0.2395785331726074,
+ "mean_token_accuracy": 0.918928150832653,
+ "num_tokens": 4433050.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.7272727272727275,
+ "eval_entropy": 0.39762327222283494,
+ "eval_loss": 0.5994202494621277,
+ "eval_mean_token_accuracy": 0.8509274201337681,
+ "eval_num_tokens": 4433050.0,
+ "eval_runtime": 86.2873,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.993,
+ "step": 1900
+ },
+ {
+ "entropy": 0.3021434534341097,
+ "epoch": 4.777085927770859,
+ "grad_norm": 0.731787383556366,
+ "learning_rate": 0.000141519962826766,
+ "loss": 0.23494718074798585,
+ "mean_token_accuracy": 0.9201403826475143,
+ "num_tokens": 4483598.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.777085927770859,
+ "eval_entropy": 0.3827026732439219,
+ "eval_loss": 0.5995895862579346,
+ "eval_mean_token_accuracy": 0.851468373523202,
+ "eval_num_tokens": 4483598.0,
+ "eval_runtime": 86.3006,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 1920
+ },
+ {
+ "entropy": 0.31626159623265265,
+ "epoch": 4.826899128268991,
+ "grad_norm": 0.8848487138748169,
+ "learning_rate": 0.00013961376213795132,
+ "loss": 0.2439030647277832,
+ "mean_token_accuracy": 0.9196575872600079,
+ "num_tokens": 4529201.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.826899128268991,
+ "eval_entropy": 0.388698436839636,
+ "eval_loss": 0.6000174283981323,
+ "eval_mean_token_accuracy": 0.8518068187458571,
+ "eval_num_tokens": 4529201.0,
+ "eval_runtime": 86.8979,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.979,
+ "step": 1940
+ },
+ {
+ "entropy": 0.30520407035946845,
+ "epoch": 4.876712328767123,
+ "grad_norm": 0.8532460927963257,
+ "learning_rate": 0.00013769957724166695,
+ "loss": 0.23458616733551024,
+ "mean_token_accuracy": 0.9221912942826748,
+ "num_tokens": 4578167.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.876712328767123,
+ "eval_entropy": 0.38777847102908203,
+ "eval_loss": 0.6004981398582458,
+ "eval_mean_token_accuracy": 0.8516481768253238,
+ "eval_num_tokens": 4578167.0,
+ "eval_runtime": 87.0777,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.975,
+ "step": 1960
+ },
+ {
+ "entropy": 0.3226448342204094,
+ "epoch": 4.926525529265255,
+ "grad_norm": 0.6945561766624451,
+ "learning_rate": 0.0001357779854299694,
+ "loss": 0.24048397541046143,
+ "mean_token_accuracy": 0.9195300146937371,
+ "num_tokens": 4622316.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.926525529265255,
+ "eval_entropy": 0.38581624263247777,
+ "eval_loss": 0.6029234528541565,
+ "eval_mean_token_accuracy": 0.8514213260523108,
+ "eval_num_tokens": 4622316.0,
+ "eval_runtime": 85.8729,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 1980
+ },
+ {
+ "entropy": 0.3051655298098922,
+ "epoch": 4.976338729763388,
+ "grad_norm": 0.7976452708244324,
+ "learning_rate": 0.00013384956622874001,
+ "loss": 0.23584742546081544,
+ "mean_token_accuracy": 0.9216851457953453,
+ "num_tokens": 4670746.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.976338729763388,
+ "eval_entropy": 0.37913159246361533,
+ "eval_loss": 0.6057604551315308,
+ "eval_mean_token_accuracy": 0.8525801203971686,
+ "eval_num_tokens": 4670746.0,
+ "eval_runtime": 86.1145,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2000
+ },
+ {
+ "entropy": 0.27438195240803254,
+ "epoch": 5.024906600249066,
+ "grad_norm": 0.6729586124420166,
+ "learning_rate": 0.0001319149012229075,
+ "loss": 0.19775952100753785,
+ "mean_token_accuracy": 0.9339428559327737,
+ "num_tokens": 4716176.0,
+ "step": 2020
+ },
+ {
+ "epoch": 5.024906600249066,
+ "eval_entropy": 0.3448961910813354,
+ "eval_loss": 0.6750120520591736,
+ "eval_mean_token_accuracy": 0.8487970232963562,
+ "eval_num_tokens": 4716176.0,
+ "eval_runtime": 86.1169,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2020
+ },
+ {
+ "entropy": 0.21423916313797237,
+ "epoch": 5.074719800747198,
+ "grad_norm": 0.6934391856193542,
+ "learning_rate": 0.00012997457388105022,
+ "loss": 0.1439570426940918,
+ "mean_token_accuracy": 0.9528236843645572,
+ "num_tokens": 4763269.0,
+ "step": 2040
+ },
+ {
+ "epoch": 5.074719800747198,
+ "eval_entropy": 0.3570949243771475,
+ "eval_loss": 0.6465504169464111,
+ "eval_mean_token_accuracy": 0.8490785547467166,
+ "eval_num_tokens": 4763269.0,
+ "eval_runtime": 85.9574,
+ "eval_samples_per_second": 15.996,
+ "eval_steps_per_second": 2.001,
+ "step": 2040
+ },
+ {
+ "entropy": 0.20838565267622472,
+ "epoch": 5.12453300124533,
+ "grad_norm": 0.7286986112594604,
+ "learning_rate": 0.00012802916937942972,
+ "loss": 0.14467307329177856,
+ "mean_token_accuracy": 0.950994835793972,
+ "num_tokens": 4809047.0,
+ "step": 2060
+ },
+ {
+ "epoch": 5.12453300124533,
+ "eval_entropy": 0.3452463157821533,
+ "eval_loss": 0.6705958843231201,
+ "eval_mean_token_accuracy": 0.8490352796953778,
+ "eval_num_tokens": 4809047.0,
+ "eval_runtime": 86.228,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 2060
+ },
+ {
+ "entropy": 0.20453082229942082,
+ "epoch": 5.174346201743462,
+ "grad_norm": 0.7515555620193481,
+ "learning_rate": 0.00012607927442550974,
+ "loss": 0.13732000589370727,
+ "mean_token_accuracy": 0.9537357829511166,
+ "num_tokens": 4857965.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.174346201743462,
+ "eval_entropy": 0.32431264914745506,
+ "eval_loss": 0.6743043065071106,
+ "eval_mean_token_accuracy": 0.8504878629085629,
+ "eval_num_tokens": 4857965.0,
+ "eval_runtime": 86.5948,
+ "eval_samples_per_second": 15.879,
+ "eval_steps_per_second": 1.986,
+ "step": 2080
+ },
+ {
+ "entropy": 0.21812320686876774,
+ "epoch": 5.224159402241594,
+ "grad_norm": 0.9093465209007263,
+ "learning_rate": 0.0001241254770810132,
+ "loss": 0.14311420917510986,
+ "mean_token_accuracy": 0.9514068141579628,
+ "num_tokens": 4905151.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.224159402241594,
+ "eval_entropy": 0.33086285835435225,
+ "eval_loss": 0.6676449179649353,
+ "eval_mean_token_accuracy": 0.8505287662495015,
+ "eval_num_tokens": 4905151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 2100
+ },
+ {
+ "entropy": 0.2180163251236081,
+ "epoch": 5.273972602739726,
+ "grad_norm": 0.6703007221221924,
+ "learning_rate": 0.00012216836658457075,
+ "loss": 0.14803968667984008,
+ "mean_token_accuracy": 0.9521303348243236,
+ "num_tokens": 4947072.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.273972602739726,
+ "eval_entropy": 0.33162341708707255,
+ "eval_loss": 0.6658875942230225,
+ "eval_mean_token_accuracy": 0.8500757605530495,
+ "eval_num_tokens": 4947072.0,
+ "eval_runtime": 86.6296,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 2120
+ },
+ {
+ "entropy": 0.22511130161583423,
+ "epoch": 5.323785803237858,
+ "grad_norm": 0.8078880906105042,
+ "learning_rate": 0.00012020853317401455,
+ "loss": 0.15228408575057983,
+ "mean_token_accuracy": 0.947144789993763,
+ "num_tokens": 4991974.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.323785803237858,
+ "eval_entropy": 0.3354601170434508,
+ "eval_loss": 0.6677829623222351,
+ "eval_mean_token_accuracy": 0.8482600024273229,
+ "eval_num_tokens": 4991974.0,
+ "eval_runtime": 86.4689,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.989,
+ "step": 2140
+ },
+ {
+ "entropy": 0.2244176059961319,
+ "epoch": 5.37359900373599,
+ "grad_norm": 0.9636075496673584,
+ "learning_rate": 0.00011824656790837037,
+ "loss": 0.15260883569717407,
+ "mean_token_accuracy": 0.9471467643976211,
+ "num_tokens": 5038400.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.37359900373599,
+ "eval_entropy": 0.3381616926297199,
+ "eval_loss": 0.6694412231445312,
+ "eval_mean_token_accuracy": 0.8482369603805764,
+ "eval_num_tokens": 5038400.0,
+ "eval_runtime": 86.4147,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 2160
+ },
+ {
+ "entropy": 0.22982364390045404,
+ "epoch": 5.423412204234122,
+ "grad_norm": 0.775401771068573,
+ "learning_rate": 0.00011628306248960262,
+ "loss": 0.15140302181243898,
+ "mean_token_accuracy": 0.9492553934454918,
+ "num_tokens": 5083166.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.423412204234122,
+ "eval_entropy": 0.3305150235808173,
+ "eval_loss": 0.6717822551727295,
+ "eval_mean_token_accuracy": 0.8489849723355715,
+ "eval_num_tokens": 5083166.0,
+ "eval_runtime": 86.4728,
+ "eval_samples_per_second": 15.901,
+ "eval_steps_per_second": 1.989,
+ "step": 2180
+ },
+ {
+ "entropy": 0.21448935717344284,
+ "epoch": 5.473225404732254,
+ "grad_norm": 0.6575281023979187,
+ "learning_rate": 0.00011431860908416465,
+ "loss": 0.1452319622039795,
+ "mean_token_accuracy": 0.9505287684500218,
+ "num_tokens": 5135109.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.473225404732254,
+ "eval_entropy": 0.3488145174328671,
+ "eval_loss": 0.6612305641174316,
+ "eval_mean_token_accuracy": 0.8492907808963642,
+ "eval_num_tokens": 5135109.0,
+ "eval_runtime": 86.6927,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 2200
+ },
+ {
+ "entropy": 0.23091202937066554,
+ "epoch": 5.523038605230386,
+ "grad_norm": 0.8909686207771301,
+ "learning_rate": 0.00011235380014440985,
+ "loss": 0.15150139331817628,
+ "mean_token_accuracy": 0.9497875183820724,
+ "num_tokens": 5180138.0,
+ "step": 2220
+ },
+ {
+ "epoch": 5.523038605230386,
+ "eval_entropy": 0.3268539015810157,
+ "eval_loss": 0.6667542457580566,
+ "eval_mean_token_accuracy": 0.8499062903398691,
+ "eval_num_tokens": 5180138.0,
+ "eval_runtime": 86.4644,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 2220
+ },
+ {
+ "entropy": 0.2227974807843566,
+ "epoch": 5.572851805728518,
+ "grad_norm": 0.6180275082588196,
+ "learning_rate": 0.0001103892282299158,
+ "loss": 0.1491069197654724,
+ "mean_token_accuracy": 0.9488144010305405,
+ "num_tokens": 5226864.0,
+ "step": 2240
+ },
+ {
+ "epoch": 5.572851805728518,
+ "eval_entropy": 0.3346347655494546,
+ "eval_loss": 0.6665948629379272,
+ "eval_mean_token_accuracy": 0.8499961893918903,
+ "eval_num_tokens": 5226864.0,
+ "eval_runtime": 87.0548,
+ "eval_samples_per_second": 15.795,
+ "eval_steps_per_second": 1.976,
+ "step": 2240
+ },
+ {
+ "entropy": 0.21368421968072654,
+ "epoch": 5.62266500622665,
+ "grad_norm": 0.6004369258880615,
+ "learning_rate": 0.00010842548582877651,
+ "loss": 0.14485255479812623,
+ "mean_token_accuracy": 0.9502056457102299,
+ "num_tokens": 5276602.0,
+ "step": 2260
+ },
+ {
+ "epoch": 5.62266500622665,
+ "eval_entropy": 0.32753298804163933,
+ "eval_loss": 0.6680151224136353,
+ "eval_mean_token_accuracy": 0.8515451086121936,
+ "eval_num_tokens": 5276602.0,
+ "eval_runtime": 86.8524,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.98,
+ "step": 2260
+ },
+ {
+ "entropy": 0.2103635374456644,
+ "epoch": 5.672478206724782,
+ "grad_norm": 0.699174702167511,
+ "learning_rate": 0.00010646316517891613,
+ "loss": 0.14297772645950318,
+ "mean_token_accuracy": 0.9512537539005279,
+ "num_tokens": 5323718.0,
+ "step": 2280
+ },
+ {
+ "epoch": 5.672478206724782,
+ "eval_entropy": 0.32966585959806,
+ "eval_loss": 0.675578773021698,
+ "eval_mean_token_accuracy": 0.8509623023659684,
+ "eval_num_tokens": 5323718.0,
+ "eval_runtime": 86.4518,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2280
+ },
+ {
+ "entropy": 0.22516900151968003,
+ "epoch": 5.722291407222914,
+ "grad_norm": 0.6637354493141174,
+ "learning_rate": 0.00010450285808947797,
+ "loss": 0.15202572345733642,
+ "mean_token_accuracy": 0.9482452072203159,
+ "num_tokens": 5369039.0,
+ "step": 2300
+ },
+ {
+ "epoch": 5.722291407222914,
+ "eval_entropy": 0.3369456917740578,
+ "eval_loss": 0.6697061061859131,
+ "eval_mean_token_accuracy": 0.848603522361711,
+ "eval_num_tokens": 5369039.0,
+ "eval_runtime": 86.6371,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.985,
+ "step": 2300
+ },
+ {
+ "entropy": 0.21841065725311637,
+ "epoch": 5.772104607721046,
+ "grad_norm": 0.7940268516540527,
+ "learning_rate": 0.00010254515576234297,
+ "loss": 0.14710167646408082,
+ "mean_token_accuracy": 0.9493498183786869,
+ "num_tokens": 5417029.0,
+ "step": 2320
+ },
+ {
+ "epoch": 5.772104607721046,
+ "eval_entropy": 0.3237486180177955,
+ "eval_loss": 0.6779657602310181,
+ "eval_mean_token_accuracy": 0.8500715313955794,
+ "eval_num_tokens": 5417029.0,
+ "eval_runtime": 86.1826,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 1.996,
+ "step": 2320
+ },
+ {
+ "entropy": 0.22146204356104135,
+ "epoch": 5.821917808219178,
+ "grad_norm": 0.9234833121299744,
+ "learning_rate": 0.00010059064861383132,
+ "loss": 0.14720046520233154,
+ "mean_token_accuracy": 0.9493872679769992,
+ "num_tokens": 5461671.0,
+ "step": 2340
+ },
+ {
+ "epoch": 5.821917808219178,
+ "eval_entropy": 0.32365207564692167,
+ "eval_loss": 0.6704005002975464,
+ "eval_mean_token_accuracy": 0.8507985760306203,
+ "eval_num_tokens": 5461671.0,
+ "eval_runtime": 86.5494,
+ "eval_samples_per_second": 15.887,
+ "eval_steps_per_second": 1.987,
+ "step": 2340
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.3074028554395648e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2360/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2360/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2360/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2360/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2360/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2360/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2360/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2360/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2360/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2360/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2360/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2360/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2360/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2360/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..7acfeabe89eaea649dc6d2988b4fd102def14d6d
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2360/trainer_state.json
@@ -0,0 +1,2512 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 5.87173100871731,
+ "eval_steps": 20,
+ "global_step": 2360,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ },
+ {
+ "entropy": 0.3193941755220294,
+ "epoch": 4.5280199252802,
+ "grad_norm": 0.8281906843185425,
+ "learning_rate": 0.0001509111761786888,
+ "loss": 0.23936262130737304,
+ "mean_token_accuracy": 0.9201708927750587,
+ "num_tokens": 4244423.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.5280199252802,
+ "eval_entropy": 0.38704028864239537,
+ "eval_loss": 0.6006569266319275,
+ "eval_mean_token_accuracy": 0.8502406720505205,
+ "eval_num_tokens": 4244423.0,
+ "eval_runtime": 86.8059,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1820
+ },
+ {
+ "entropy": 0.3164879363030195,
+ "epoch": 4.577833125778331,
+ "grad_norm": 0.7892968654632568,
+ "learning_rate": 0.00014905346557909867,
+ "loss": 0.24541733264923096,
+ "mean_token_accuracy": 0.9175932116806507,
+ "num_tokens": 4289773.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.577833125778331,
+ "eval_entropy": 0.38861122120951497,
+ "eval_loss": 0.6115967631340027,
+ "eval_mean_token_accuracy": 0.849471275196519,
+ "eval_num_tokens": 4289773.0,
+ "eval_runtime": 86.2946,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1840
+ },
+ {
+ "entropy": 0.3051785985007882,
+ "epoch": 4.627646326276463,
+ "grad_norm": 0.8109654188156128,
+ "learning_rate": 0.0001471849238862319,
+ "loss": 0.23433220386505127,
+ "mean_token_accuracy": 0.9206570319831371,
+ "num_tokens": 4336894.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.627646326276463,
+ "eval_entropy": 0.37162452295076015,
+ "eval_loss": 0.6184061765670776,
+ "eval_mean_token_accuracy": 0.8501173268223918,
+ "eval_num_tokens": 4336894.0,
+ "eval_runtime": 86.6865,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1860
+ },
+ {
+ "entropy": 0.3168198253959417,
+ "epoch": 4.677459526774595,
+ "grad_norm": 0.9512342214584351,
+ "learning_rate": 0.0001453061146267775,
+ "loss": 0.23832404613494873,
+ "mean_token_accuracy": 0.9197044663131237,
+ "num_tokens": 4382947.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.677459526774595,
+ "eval_entropy": 0.3845940856912801,
+ "eval_loss": 0.606762707233429,
+ "eval_mean_token_accuracy": 0.8504838194957999,
+ "eval_num_tokens": 4382947.0,
+ "eval_runtime": 86.5175,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 1880
+ },
+ {
+ "entropy": 0.30791807882487776,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 0.8123113512992859,
+ "learning_rate": 0.00014341760442398248,
+ "loss": 0.2395785331726074,
+ "mean_token_accuracy": 0.918928150832653,
+ "num_tokens": 4433050.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.7272727272727275,
+ "eval_entropy": 0.39762327222283494,
+ "eval_loss": 0.5994202494621277,
+ "eval_mean_token_accuracy": 0.8509274201337681,
+ "eval_num_tokens": 4433050.0,
+ "eval_runtime": 86.2873,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.993,
+ "step": 1900
+ },
+ {
+ "entropy": 0.3021434534341097,
+ "epoch": 4.777085927770859,
+ "grad_norm": 0.731787383556366,
+ "learning_rate": 0.000141519962826766,
+ "loss": 0.23494718074798585,
+ "mean_token_accuracy": 0.9201403826475143,
+ "num_tokens": 4483598.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.777085927770859,
+ "eval_entropy": 0.3827026732439219,
+ "eval_loss": 0.5995895862579346,
+ "eval_mean_token_accuracy": 0.851468373523202,
+ "eval_num_tokens": 4483598.0,
+ "eval_runtime": 86.3006,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 1920
+ },
+ {
+ "entropy": 0.31626159623265265,
+ "epoch": 4.826899128268991,
+ "grad_norm": 0.8848487138748169,
+ "learning_rate": 0.00013961376213795132,
+ "loss": 0.2439030647277832,
+ "mean_token_accuracy": 0.9196575872600079,
+ "num_tokens": 4529201.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.826899128268991,
+ "eval_entropy": 0.388698436839636,
+ "eval_loss": 0.6000174283981323,
+ "eval_mean_token_accuracy": 0.8518068187458571,
+ "eval_num_tokens": 4529201.0,
+ "eval_runtime": 86.8979,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.979,
+ "step": 1940
+ },
+ {
+ "entropy": 0.30520407035946845,
+ "epoch": 4.876712328767123,
+ "grad_norm": 0.8532460927963257,
+ "learning_rate": 0.00013769957724166695,
+ "loss": 0.23458616733551024,
+ "mean_token_accuracy": 0.9221912942826748,
+ "num_tokens": 4578167.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.876712328767123,
+ "eval_entropy": 0.38777847102908203,
+ "eval_loss": 0.6004981398582458,
+ "eval_mean_token_accuracy": 0.8516481768253238,
+ "eval_num_tokens": 4578167.0,
+ "eval_runtime": 87.0777,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.975,
+ "step": 1960
+ },
+ {
+ "entropy": 0.3226448342204094,
+ "epoch": 4.926525529265255,
+ "grad_norm": 0.6945561766624451,
+ "learning_rate": 0.0001357779854299694,
+ "loss": 0.24048397541046143,
+ "mean_token_accuracy": 0.9195300146937371,
+ "num_tokens": 4622316.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.926525529265255,
+ "eval_entropy": 0.38581624263247777,
+ "eval_loss": 0.6029234528541565,
+ "eval_mean_token_accuracy": 0.8514213260523108,
+ "eval_num_tokens": 4622316.0,
+ "eval_runtime": 85.8729,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 1980
+ },
+ {
+ "entropy": 0.3051655298098922,
+ "epoch": 4.976338729763388,
+ "grad_norm": 0.7976452708244324,
+ "learning_rate": 0.00013384956622874001,
+ "loss": 0.23584742546081544,
+ "mean_token_accuracy": 0.9216851457953453,
+ "num_tokens": 4670746.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.976338729763388,
+ "eval_entropy": 0.37913159246361533,
+ "eval_loss": 0.6057604551315308,
+ "eval_mean_token_accuracy": 0.8525801203971686,
+ "eval_num_tokens": 4670746.0,
+ "eval_runtime": 86.1145,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2000
+ },
+ {
+ "entropy": 0.27438195240803254,
+ "epoch": 5.024906600249066,
+ "grad_norm": 0.6729586124420166,
+ "learning_rate": 0.0001319149012229075,
+ "loss": 0.19775952100753785,
+ "mean_token_accuracy": 0.9339428559327737,
+ "num_tokens": 4716176.0,
+ "step": 2020
+ },
+ {
+ "epoch": 5.024906600249066,
+ "eval_entropy": 0.3448961910813354,
+ "eval_loss": 0.6750120520591736,
+ "eval_mean_token_accuracy": 0.8487970232963562,
+ "eval_num_tokens": 4716176.0,
+ "eval_runtime": 86.1169,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2020
+ },
+ {
+ "entropy": 0.21423916313797237,
+ "epoch": 5.074719800747198,
+ "grad_norm": 0.6934391856193542,
+ "learning_rate": 0.00012997457388105022,
+ "loss": 0.1439570426940918,
+ "mean_token_accuracy": 0.9528236843645572,
+ "num_tokens": 4763269.0,
+ "step": 2040
+ },
+ {
+ "epoch": 5.074719800747198,
+ "eval_entropy": 0.3570949243771475,
+ "eval_loss": 0.6465504169464111,
+ "eval_mean_token_accuracy": 0.8490785547467166,
+ "eval_num_tokens": 4763269.0,
+ "eval_runtime": 85.9574,
+ "eval_samples_per_second": 15.996,
+ "eval_steps_per_second": 2.001,
+ "step": 2040
+ },
+ {
+ "entropy": 0.20838565267622472,
+ "epoch": 5.12453300124533,
+ "grad_norm": 0.7286986112594604,
+ "learning_rate": 0.00012802916937942972,
+ "loss": 0.14467307329177856,
+ "mean_token_accuracy": 0.950994835793972,
+ "num_tokens": 4809047.0,
+ "step": 2060
+ },
+ {
+ "epoch": 5.12453300124533,
+ "eval_entropy": 0.3452463157821533,
+ "eval_loss": 0.6705958843231201,
+ "eval_mean_token_accuracy": 0.8490352796953778,
+ "eval_num_tokens": 4809047.0,
+ "eval_runtime": 86.228,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 2060
+ },
+ {
+ "entropy": 0.20453082229942082,
+ "epoch": 5.174346201743462,
+ "grad_norm": 0.7515555620193481,
+ "learning_rate": 0.00012607927442550974,
+ "loss": 0.13732000589370727,
+ "mean_token_accuracy": 0.9537357829511166,
+ "num_tokens": 4857965.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.174346201743462,
+ "eval_entropy": 0.32431264914745506,
+ "eval_loss": 0.6743043065071106,
+ "eval_mean_token_accuracy": 0.8504878629085629,
+ "eval_num_tokens": 4857965.0,
+ "eval_runtime": 86.5948,
+ "eval_samples_per_second": 15.879,
+ "eval_steps_per_second": 1.986,
+ "step": 2080
+ },
+ {
+ "entropy": 0.21812320686876774,
+ "epoch": 5.224159402241594,
+ "grad_norm": 0.9093465209007263,
+ "learning_rate": 0.0001241254770810132,
+ "loss": 0.14311420917510986,
+ "mean_token_accuracy": 0.9514068141579628,
+ "num_tokens": 4905151.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.224159402241594,
+ "eval_entropy": 0.33086285835435225,
+ "eval_loss": 0.6676449179649353,
+ "eval_mean_token_accuracy": 0.8505287662495015,
+ "eval_num_tokens": 4905151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 2100
+ },
+ {
+ "entropy": 0.2180163251236081,
+ "epoch": 5.273972602739726,
+ "grad_norm": 0.6703007221221924,
+ "learning_rate": 0.00012216836658457075,
+ "loss": 0.14803968667984008,
+ "mean_token_accuracy": 0.9521303348243236,
+ "num_tokens": 4947072.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.273972602739726,
+ "eval_entropy": 0.33162341708707255,
+ "eval_loss": 0.6658875942230225,
+ "eval_mean_token_accuracy": 0.8500757605530495,
+ "eval_num_tokens": 4947072.0,
+ "eval_runtime": 86.6296,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 2120
+ },
+ {
+ "entropy": 0.22511130161583423,
+ "epoch": 5.323785803237858,
+ "grad_norm": 0.8078880906105042,
+ "learning_rate": 0.00012020853317401455,
+ "loss": 0.15228408575057983,
+ "mean_token_accuracy": 0.947144789993763,
+ "num_tokens": 4991974.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.323785803237858,
+ "eval_entropy": 0.3354601170434508,
+ "eval_loss": 0.6677829623222351,
+ "eval_mean_token_accuracy": 0.8482600024273229,
+ "eval_num_tokens": 4991974.0,
+ "eval_runtime": 86.4689,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.989,
+ "step": 2140
+ },
+ {
+ "entropy": 0.2244176059961319,
+ "epoch": 5.37359900373599,
+ "grad_norm": 0.9636075496673584,
+ "learning_rate": 0.00011824656790837037,
+ "loss": 0.15260883569717407,
+ "mean_token_accuracy": 0.9471467643976211,
+ "num_tokens": 5038400.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.37359900373599,
+ "eval_entropy": 0.3381616926297199,
+ "eval_loss": 0.6694412231445312,
+ "eval_mean_token_accuracy": 0.8482369603805764,
+ "eval_num_tokens": 5038400.0,
+ "eval_runtime": 86.4147,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 2160
+ },
+ {
+ "entropy": 0.22982364390045404,
+ "epoch": 5.423412204234122,
+ "grad_norm": 0.775401771068573,
+ "learning_rate": 0.00011628306248960262,
+ "loss": 0.15140302181243898,
+ "mean_token_accuracy": 0.9492553934454918,
+ "num_tokens": 5083166.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.423412204234122,
+ "eval_entropy": 0.3305150235808173,
+ "eval_loss": 0.6717822551727295,
+ "eval_mean_token_accuracy": 0.8489849723355715,
+ "eval_num_tokens": 5083166.0,
+ "eval_runtime": 86.4728,
+ "eval_samples_per_second": 15.901,
+ "eval_steps_per_second": 1.989,
+ "step": 2180
+ },
+ {
+ "entropy": 0.21448935717344284,
+ "epoch": 5.473225404732254,
+ "grad_norm": 0.6575281023979187,
+ "learning_rate": 0.00011431860908416465,
+ "loss": 0.1452319622039795,
+ "mean_token_accuracy": 0.9505287684500218,
+ "num_tokens": 5135109.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.473225404732254,
+ "eval_entropy": 0.3488145174328671,
+ "eval_loss": 0.6612305641174316,
+ "eval_mean_token_accuracy": 0.8492907808963642,
+ "eval_num_tokens": 5135109.0,
+ "eval_runtime": 86.6927,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 2200
+ },
+ {
+ "entropy": 0.23091202937066554,
+ "epoch": 5.523038605230386,
+ "grad_norm": 0.8909686207771301,
+ "learning_rate": 0.00011235380014440985,
+ "loss": 0.15150139331817628,
+ "mean_token_accuracy": 0.9497875183820724,
+ "num_tokens": 5180138.0,
+ "step": 2220
+ },
+ {
+ "epoch": 5.523038605230386,
+ "eval_entropy": 0.3268539015810157,
+ "eval_loss": 0.6667542457580566,
+ "eval_mean_token_accuracy": 0.8499062903398691,
+ "eval_num_tokens": 5180138.0,
+ "eval_runtime": 86.4644,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 2220
+ },
+ {
+ "entropy": 0.2227974807843566,
+ "epoch": 5.572851805728518,
+ "grad_norm": 0.6180275082588196,
+ "learning_rate": 0.0001103892282299158,
+ "loss": 0.1491069197654724,
+ "mean_token_accuracy": 0.9488144010305405,
+ "num_tokens": 5226864.0,
+ "step": 2240
+ },
+ {
+ "epoch": 5.572851805728518,
+ "eval_entropy": 0.3346347655494546,
+ "eval_loss": 0.6665948629379272,
+ "eval_mean_token_accuracy": 0.8499961893918903,
+ "eval_num_tokens": 5226864.0,
+ "eval_runtime": 87.0548,
+ "eval_samples_per_second": 15.795,
+ "eval_steps_per_second": 1.976,
+ "step": 2240
+ },
+ {
+ "entropy": 0.21368421968072654,
+ "epoch": 5.62266500622665,
+ "grad_norm": 0.6004369258880615,
+ "learning_rate": 0.00010842548582877651,
+ "loss": 0.14485255479812623,
+ "mean_token_accuracy": 0.9502056457102299,
+ "num_tokens": 5276602.0,
+ "step": 2260
+ },
+ {
+ "epoch": 5.62266500622665,
+ "eval_entropy": 0.32753298804163933,
+ "eval_loss": 0.6680151224136353,
+ "eval_mean_token_accuracy": 0.8515451086121936,
+ "eval_num_tokens": 5276602.0,
+ "eval_runtime": 86.8524,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.98,
+ "step": 2260
+ },
+ {
+ "entropy": 0.2103635374456644,
+ "epoch": 5.672478206724782,
+ "grad_norm": 0.699174702167511,
+ "learning_rate": 0.00010646316517891613,
+ "loss": 0.14297772645950318,
+ "mean_token_accuracy": 0.9512537539005279,
+ "num_tokens": 5323718.0,
+ "step": 2280
+ },
+ {
+ "epoch": 5.672478206724782,
+ "eval_entropy": 0.32966585959806,
+ "eval_loss": 0.675578773021698,
+ "eval_mean_token_accuracy": 0.8509623023659684,
+ "eval_num_tokens": 5323718.0,
+ "eval_runtime": 86.4518,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2280
+ },
+ {
+ "entropy": 0.22516900151968003,
+ "epoch": 5.722291407222914,
+ "grad_norm": 0.6637354493141174,
+ "learning_rate": 0.00010450285808947797,
+ "loss": 0.15202572345733642,
+ "mean_token_accuracy": 0.9482452072203159,
+ "num_tokens": 5369039.0,
+ "step": 2300
+ },
+ {
+ "epoch": 5.722291407222914,
+ "eval_entropy": 0.3369456917740578,
+ "eval_loss": 0.6697061061859131,
+ "eval_mean_token_accuracy": 0.848603522361711,
+ "eval_num_tokens": 5369039.0,
+ "eval_runtime": 86.6371,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.985,
+ "step": 2300
+ },
+ {
+ "entropy": 0.21841065725311637,
+ "epoch": 5.772104607721046,
+ "grad_norm": 0.7940268516540527,
+ "learning_rate": 0.00010254515576234297,
+ "loss": 0.14710167646408082,
+ "mean_token_accuracy": 0.9493498183786869,
+ "num_tokens": 5417029.0,
+ "step": 2320
+ },
+ {
+ "epoch": 5.772104607721046,
+ "eval_entropy": 0.3237486180177955,
+ "eval_loss": 0.6779657602310181,
+ "eval_mean_token_accuracy": 0.8500715313955794,
+ "eval_num_tokens": 5417029.0,
+ "eval_runtime": 86.1826,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 1.996,
+ "step": 2320
+ },
+ {
+ "entropy": 0.22146204356104135,
+ "epoch": 5.821917808219178,
+ "grad_norm": 0.9234833121299744,
+ "learning_rate": 0.00010059064861383132,
+ "loss": 0.14720046520233154,
+ "mean_token_accuracy": 0.9493872679769992,
+ "num_tokens": 5461671.0,
+ "step": 2340
+ },
+ {
+ "epoch": 5.821917808219178,
+ "eval_entropy": 0.32365207564692167,
+ "eval_loss": 0.6704005002975464,
+ "eval_mean_token_accuracy": 0.8507985760306203,
+ "eval_num_tokens": 5461671.0,
+ "eval_runtime": 86.5494,
+ "eval_samples_per_second": 15.887,
+ "eval_steps_per_second": 1.987,
+ "step": 2340
+ },
+ {
+ "entropy": 0.20934011954814197,
+ "epoch": 5.87173100871731,
+ "grad_norm": 0.5547503232955933,
+ "learning_rate": 9.863992609664084e-05,
+ "loss": 0.1464867353439331,
+ "mean_token_accuracy": 0.9503875687718392,
+ "num_tokens": 5509312.0,
+ "step": 2360
+ },
+ {
+ "epoch": 5.87173100871731,
+ "eval_entropy": 0.3330401429083458,
+ "eval_loss": 0.6659091114997864,
+ "eval_mean_token_accuracy": 0.8504848906467127,
+ "eval_num_tokens": 5509312.0,
+ "eval_runtime": 86.5855,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 2360
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.32657339338326e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2380/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2380/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2380/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2380/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2380/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2380/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2380/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2380/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2380/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2380/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2380/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2380/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2380/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2380/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..0cbffdaac753b4216dcd0469ddb62ae008c960a9
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2380/trainer_state.json
@@ -0,0 +1,2533 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 5.921544209215442,
+ "eval_steps": 20,
+ "global_step": 2380,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ },
+ {
+ "entropy": 0.3193941755220294,
+ "epoch": 4.5280199252802,
+ "grad_norm": 0.8281906843185425,
+ "learning_rate": 0.0001509111761786888,
+ "loss": 0.23936262130737304,
+ "mean_token_accuracy": 0.9201708927750587,
+ "num_tokens": 4244423.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.5280199252802,
+ "eval_entropy": 0.38704028864239537,
+ "eval_loss": 0.6006569266319275,
+ "eval_mean_token_accuracy": 0.8502406720505205,
+ "eval_num_tokens": 4244423.0,
+ "eval_runtime": 86.8059,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1820
+ },
+ {
+ "entropy": 0.3164879363030195,
+ "epoch": 4.577833125778331,
+ "grad_norm": 0.7892968654632568,
+ "learning_rate": 0.00014905346557909867,
+ "loss": 0.24541733264923096,
+ "mean_token_accuracy": 0.9175932116806507,
+ "num_tokens": 4289773.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.577833125778331,
+ "eval_entropy": 0.38861122120951497,
+ "eval_loss": 0.6115967631340027,
+ "eval_mean_token_accuracy": 0.849471275196519,
+ "eval_num_tokens": 4289773.0,
+ "eval_runtime": 86.2946,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1840
+ },
+ {
+ "entropy": 0.3051785985007882,
+ "epoch": 4.627646326276463,
+ "grad_norm": 0.8109654188156128,
+ "learning_rate": 0.0001471849238862319,
+ "loss": 0.23433220386505127,
+ "mean_token_accuracy": 0.9206570319831371,
+ "num_tokens": 4336894.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.627646326276463,
+ "eval_entropy": 0.37162452295076015,
+ "eval_loss": 0.6184061765670776,
+ "eval_mean_token_accuracy": 0.8501173268223918,
+ "eval_num_tokens": 4336894.0,
+ "eval_runtime": 86.6865,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1860
+ },
+ {
+ "entropy": 0.3168198253959417,
+ "epoch": 4.677459526774595,
+ "grad_norm": 0.9512342214584351,
+ "learning_rate": 0.0001453061146267775,
+ "loss": 0.23832404613494873,
+ "mean_token_accuracy": 0.9197044663131237,
+ "num_tokens": 4382947.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.677459526774595,
+ "eval_entropy": 0.3845940856912801,
+ "eval_loss": 0.606762707233429,
+ "eval_mean_token_accuracy": 0.8504838194957999,
+ "eval_num_tokens": 4382947.0,
+ "eval_runtime": 86.5175,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 1880
+ },
+ {
+ "entropy": 0.30791807882487776,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 0.8123113512992859,
+ "learning_rate": 0.00014341760442398248,
+ "loss": 0.2395785331726074,
+ "mean_token_accuracy": 0.918928150832653,
+ "num_tokens": 4433050.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.7272727272727275,
+ "eval_entropy": 0.39762327222283494,
+ "eval_loss": 0.5994202494621277,
+ "eval_mean_token_accuracy": 0.8509274201337681,
+ "eval_num_tokens": 4433050.0,
+ "eval_runtime": 86.2873,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.993,
+ "step": 1900
+ },
+ {
+ "entropy": 0.3021434534341097,
+ "epoch": 4.777085927770859,
+ "grad_norm": 0.731787383556366,
+ "learning_rate": 0.000141519962826766,
+ "loss": 0.23494718074798585,
+ "mean_token_accuracy": 0.9201403826475143,
+ "num_tokens": 4483598.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.777085927770859,
+ "eval_entropy": 0.3827026732439219,
+ "eval_loss": 0.5995895862579346,
+ "eval_mean_token_accuracy": 0.851468373523202,
+ "eval_num_tokens": 4483598.0,
+ "eval_runtime": 86.3006,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 1920
+ },
+ {
+ "entropy": 0.31626159623265265,
+ "epoch": 4.826899128268991,
+ "grad_norm": 0.8848487138748169,
+ "learning_rate": 0.00013961376213795132,
+ "loss": 0.2439030647277832,
+ "mean_token_accuracy": 0.9196575872600079,
+ "num_tokens": 4529201.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.826899128268991,
+ "eval_entropy": 0.388698436839636,
+ "eval_loss": 0.6000174283981323,
+ "eval_mean_token_accuracy": 0.8518068187458571,
+ "eval_num_tokens": 4529201.0,
+ "eval_runtime": 86.8979,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.979,
+ "step": 1940
+ },
+ {
+ "entropy": 0.30520407035946845,
+ "epoch": 4.876712328767123,
+ "grad_norm": 0.8532460927963257,
+ "learning_rate": 0.00013769957724166695,
+ "loss": 0.23458616733551024,
+ "mean_token_accuracy": 0.9221912942826748,
+ "num_tokens": 4578167.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.876712328767123,
+ "eval_entropy": 0.38777847102908203,
+ "eval_loss": 0.6004981398582458,
+ "eval_mean_token_accuracy": 0.8516481768253238,
+ "eval_num_tokens": 4578167.0,
+ "eval_runtime": 87.0777,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.975,
+ "step": 1960
+ },
+ {
+ "entropy": 0.3226448342204094,
+ "epoch": 4.926525529265255,
+ "grad_norm": 0.6945561766624451,
+ "learning_rate": 0.0001357779854299694,
+ "loss": 0.24048397541046143,
+ "mean_token_accuracy": 0.9195300146937371,
+ "num_tokens": 4622316.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.926525529265255,
+ "eval_entropy": 0.38581624263247777,
+ "eval_loss": 0.6029234528541565,
+ "eval_mean_token_accuracy": 0.8514213260523108,
+ "eval_num_tokens": 4622316.0,
+ "eval_runtime": 85.8729,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 1980
+ },
+ {
+ "entropy": 0.3051655298098922,
+ "epoch": 4.976338729763388,
+ "grad_norm": 0.7976452708244324,
+ "learning_rate": 0.00013384956622874001,
+ "loss": 0.23584742546081544,
+ "mean_token_accuracy": 0.9216851457953453,
+ "num_tokens": 4670746.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.976338729763388,
+ "eval_entropy": 0.37913159246361533,
+ "eval_loss": 0.6057604551315308,
+ "eval_mean_token_accuracy": 0.8525801203971686,
+ "eval_num_tokens": 4670746.0,
+ "eval_runtime": 86.1145,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2000
+ },
+ {
+ "entropy": 0.27438195240803254,
+ "epoch": 5.024906600249066,
+ "grad_norm": 0.6729586124420166,
+ "learning_rate": 0.0001319149012229075,
+ "loss": 0.19775952100753785,
+ "mean_token_accuracy": 0.9339428559327737,
+ "num_tokens": 4716176.0,
+ "step": 2020
+ },
+ {
+ "epoch": 5.024906600249066,
+ "eval_entropy": 0.3448961910813354,
+ "eval_loss": 0.6750120520591736,
+ "eval_mean_token_accuracy": 0.8487970232963562,
+ "eval_num_tokens": 4716176.0,
+ "eval_runtime": 86.1169,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2020
+ },
+ {
+ "entropy": 0.21423916313797237,
+ "epoch": 5.074719800747198,
+ "grad_norm": 0.6934391856193542,
+ "learning_rate": 0.00012997457388105022,
+ "loss": 0.1439570426940918,
+ "mean_token_accuracy": 0.9528236843645572,
+ "num_tokens": 4763269.0,
+ "step": 2040
+ },
+ {
+ "epoch": 5.074719800747198,
+ "eval_entropy": 0.3570949243771475,
+ "eval_loss": 0.6465504169464111,
+ "eval_mean_token_accuracy": 0.8490785547467166,
+ "eval_num_tokens": 4763269.0,
+ "eval_runtime": 85.9574,
+ "eval_samples_per_second": 15.996,
+ "eval_steps_per_second": 2.001,
+ "step": 2040
+ },
+ {
+ "entropy": 0.20838565267622472,
+ "epoch": 5.12453300124533,
+ "grad_norm": 0.7286986112594604,
+ "learning_rate": 0.00012802916937942972,
+ "loss": 0.14467307329177856,
+ "mean_token_accuracy": 0.950994835793972,
+ "num_tokens": 4809047.0,
+ "step": 2060
+ },
+ {
+ "epoch": 5.12453300124533,
+ "eval_entropy": 0.3452463157821533,
+ "eval_loss": 0.6705958843231201,
+ "eval_mean_token_accuracy": 0.8490352796953778,
+ "eval_num_tokens": 4809047.0,
+ "eval_runtime": 86.228,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 2060
+ },
+ {
+ "entropy": 0.20453082229942082,
+ "epoch": 5.174346201743462,
+ "grad_norm": 0.7515555620193481,
+ "learning_rate": 0.00012607927442550974,
+ "loss": 0.13732000589370727,
+ "mean_token_accuracy": 0.9537357829511166,
+ "num_tokens": 4857965.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.174346201743462,
+ "eval_entropy": 0.32431264914745506,
+ "eval_loss": 0.6743043065071106,
+ "eval_mean_token_accuracy": 0.8504878629085629,
+ "eval_num_tokens": 4857965.0,
+ "eval_runtime": 86.5948,
+ "eval_samples_per_second": 15.879,
+ "eval_steps_per_second": 1.986,
+ "step": 2080
+ },
+ {
+ "entropy": 0.21812320686876774,
+ "epoch": 5.224159402241594,
+ "grad_norm": 0.9093465209007263,
+ "learning_rate": 0.0001241254770810132,
+ "loss": 0.14311420917510986,
+ "mean_token_accuracy": 0.9514068141579628,
+ "num_tokens": 4905151.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.224159402241594,
+ "eval_entropy": 0.33086285835435225,
+ "eval_loss": 0.6676449179649353,
+ "eval_mean_token_accuracy": 0.8505287662495015,
+ "eval_num_tokens": 4905151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 2100
+ },
+ {
+ "entropy": 0.2180163251236081,
+ "epoch": 5.273972602739726,
+ "grad_norm": 0.6703007221221924,
+ "learning_rate": 0.00012216836658457075,
+ "loss": 0.14803968667984008,
+ "mean_token_accuracy": 0.9521303348243236,
+ "num_tokens": 4947072.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.273972602739726,
+ "eval_entropy": 0.33162341708707255,
+ "eval_loss": 0.6658875942230225,
+ "eval_mean_token_accuracy": 0.8500757605530495,
+ "eval_num_tokens": 4947072.0,
+ "eval_runtime": 86.6296,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 2120
+ },
+ {
+ "entropy": 0.22511130161583423,
+ "epoch": 5.323785803237858,
+ "grad_norm": 0.8078880906105042,
+ "learning_rate": 0.00012020853317401455,
+ "loss": 0.15228408575057983,
+ "mean_token_accuracy": 0.947144789993763,
+ "num_tokens": 4991974.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.323785803237858,
+ "eval_entropy": 0.3354601170434508,
+ "eval_loss": 0.6677829623222351,
+ "eval_mean_token_accuracy": 0.8482600024273229,
+ "eval_num_tokens": 4991974.0,
+ "eval_runtime": 86.4689,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.989,
+ "step": 2140
+ },
+ {
+ "entropy": 0.2244176059961319,
+ "epoch": 5.37359900373599,
+ "grad_norm": 0.9636075496673584,
+ "learning_rate": 0.00011824656790837037,
+ "loss": 0.15260883569717407,
+ "mean_token_accuracy": 0.9471467643976211,
+ "num_tokens": 5038400.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.37359900373599,
+ "eval_entropy": 0.3381616926297199,
+ "eval_loss": 0.6694412231445312,
+ "eval_mean_token_accuracy": 0.8482369603805764,
+ "eval_num_tokens": 5038400.0,
+ "eval_runtime": 86.4147,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 2160
+ },
+ {
+ "entropy": 0.22982364390045404,
+ "epoch": 5.423412204234122,
+ "grad_norm": 0.775401771068573,
+ "learning_rate": 0.00011628306248960262,
+ "loss": 0.15140302181243898,
+ "mean_token_accuracy": 0.9492553934454918,
+ "num_tokens": 5083166.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.423412204234122,
+ "eval_entropy": 0.3305150235808173,
+ "eval_loss": 0.6717822551727295,
+ "eval_mean_token_accuracy": 0.8489849723355715,
+ "eval_num_tokens": 5083166.0,
+ "eval_runtime": 86.4728,
+ "eval_samples_per_second": 15.901,
+ "eval_steps_per_second": 1.989,
+ "step": 2180
+ },
+ {
+ "entropy": 0.21448935717344284,
+ "epoch": 5.473225404732254,
+ "grad_norm": 0.6575281023979187,
+ "learning_rate": 0.00011431860908416465,
+ "loss": 0.1452319622039795,
+ "mean_token_accuracy": 0.9505287684500218,
+ "num_tokens": 5135109.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.473225404732254,
+ "eval_entropy": 0.3488145174328671,
+ "eval_loss": 0.6612305641174316,
+ "eval_mean_token_accuracy": 0.8492907808963642,
+ "eval_num_tokens": 5135109.0,
+ "eval_runtime": 86.6927,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 2200
+ },
+ {
+ "entropy": 0.23091202937066554,
+ "epoch": 5.523038605230386,
+ "grad_norm": 0.8909686207771301,
+ "learning_rate": 0.00011235380014440985,
+ "loss": 0.15150139331817628,
+ "mean_token_accuracy": 0.9497875183820724,
+ "num_tokens": 5180138.0,
+ "step": 2220
+ },
+ {
+ "epoch": 5.523038605230386,
+ "eval_entropy": 0.3268539015810157,
+ "eval_loss": 0.6667542457580566,
+ "eval_mean_token_accuracy": 0.8499062903398691,
+ "eval_num_tokens": 5180138.0,
+ "eval_runtime": 86.4644,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 2220
+ },
+ {
+ "entropy": 0.2227974807843566,
+ "epoch": 5.572851805728518,
+ "grad_norm": 0.6180275082588196,
+ "learning_rate": 0.0001103892282299158,
+ "loss": 0.1491069197654724,
+ "mean_token_accuracy": 0.9488144010305405,
+ "num_tokens": 5226864.0,
+ "step": 2240
+ },
+ {
+ "epoch": 5.572851805728518,
+ "eval_entropy": 0.3346347655494546,
+ "eval_loss": 0.6665948629379272,
+ "eval_mean_token_accuracy": 0.8499961893918903,
+ "eval_num_tokens": 5226864.0,
+ "eval_runtime": 87.0548,
+ "eval_samples_per_second": 15.795,
+ "eval_steps_per_second": 1.976,
+ "step": 2240
+ },
+ {
+ "entropy": 0.21368421968072654,
+ "epoch": 5.62266500622665,
+ "grad_norm": 0.6004369258880615,
+ "learning_rate": 0.00010842548582877651,
+ "loss": 0.14485255479812623,
+ "mean_token_accuracy": 0.9502056457102299,
+ "num_tokens": 5276602.0,
+ "step": 2260
+ },
+ {
+ "epoch": 5.62266500622665,
+ "eval_entropy": 0.32753298804163933,
+ "eval_loss": 0.6680151224136353,
+ "eval_mean_token_accuracy": 0.8515451086121936,
+ "eval_num_tokens": 5276602.0,
+ "eval_runtime": 86.8524,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.98,
+ "step": 2260
+ },
+ {
+ "entropy": 0.2103635374456644,
+ "epoch": 5.672478206724782,
+ "grad_norm": 0.699174702167511,
+ "learning_rate": 0.00010646316517891613,
+ "loss": 0.14297772645950318,
+ "mean_token_accuracy": 0.9512537539005279,
+ "num_tokens": 5323718.0,
+ "step": 2280
+ },
+ {
+ "epoch": 5.672478206724782,
+ "eval_entropy": 0.32966585959806,
+ "eval_loss": 0.675578773021698,
+ "eval_mean_token_accuracy": 0.8509623023659684,
+ "eval_num_tokens": 5323718.0,
+ "eval_runtime": 86.4518,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2280
+ },
+ {
+ "entropy": 0.22516900151968003,
+ "epoch": 5.722291407222914,
+ "grad_norm": 0.6637354493141174,
+ "learning_rate": 0.00010450285808947797,
+ "loss": 0.15202572345733642,
+ "mean_token_accuracy": 0.9482452072203159,
+ "num_tokens": 5369039.0,
+ "step": 2300
+ },
+ {
+ "epoch": 5.722291407222914,
+ "eval_entropy": 0.3369456917740578,
+ "eval_loss": 0.6697061061859131,
+ "eval_mean_token_accuracy": 0.848603522361711,
+ "eval_num_tokens": 5369039.0,
+ "eval_runtime": 86.6371,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.985,
+ "step": 2300
+ },
+ {
+ "entropy": 0.21841065725311637,
+ "epoch": 5.772104607721046,
+ "grad_norm": 0.7940268516540527,
+ "learning_rate": 0.00010254515576234297,
+ "loss": 0.14710167646408082,
+ "mean_token_accuracy": 0.9493498183786869,
+ "num_tokens": 5417029.0,
+ "step": 2320
+ },
+ {
+ "epoch": 5.772104607721046,
+ "eval_entropy": 0.3237486180177955,
+ "eval_loss": 0.6779657602310181,
+ "eval_mean_token_accuracy": 0.8500715313955794,
+ "eval_num_tokens": 5417029.0,
+ "eval_runtime": 86.1826,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 1.996,
+ "step": 2320
+ },
+ {
+ "entropy": 0.22146204356104135,
+ "epoch": 5.821917808219178,
+ "grad_norm": 0.9234833121299744,
+ "learning_rate": 0.00010059064861383132,
+ "loss": 0.14720046520233154,
+ "mean_token_accuracy": 0.9493872679769992,
+ "num_tokens": 5461671.0,
+ "step": 2340
+ },
+ {
+ "epoch": 5.821917808219178,
+ "eval_entropy": 0.32365207564692167,
+ "eval_loss": 0.6704005002975464,
+ "eval_mean_token_accuracy": 0.8507985760306203,
+ "eval_num_tokens": 5461671.0,
+ "eval_runtime": 86.5494,
+ "eval_samples_per_second": 15.887,
+ "eval_steps_per_second": 1.987,
+ "step": 2340
+ },
+ {
+ "entropy": 0.20934011954814197,
+ "epoch": 5.87173100871731,
+ "grad_norm": 0.5547503232955933,
+ "learning_rate": 9.863992609664084e-05,
+ "loss": 0.1464867353439331,
+ "mean_token_accuracy": 0.9503875687718392,
+ "num_tokens": 5509312.0,
+ "step": 2360
+ },
+ {
+ "epoch": 5.87173100871731,
+ "eval_entropy": 0.3330401429083458,
+ "eval_loss": 0.6659091114997864,
+ "eval_mean_token_accuracy": 0.8504848906467127,
+ "eval_num_tokens": 5509312.0,
+ "eval_runtime": 86.5855,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 2360
+ },
+ {
+ "entropy": 0.21678635366261007,
+ "epoch": 5.921544209215442,
+ "grad_norm": 0.570612907409668,
+ "learning_rate": 9.669357652207635e-05,
+ "loss": 0.14821385145187377,
+ "mean_token_accuracy": 0.9503940217196941,
+ "num_tokens": 5558196.0,
+ "step": 2380
+ },
+ {
+ "epoch": 5.921544209215442,
+ "eval_entropy": 0.3322022325077722,
+ "eval_loss": 0.6722489595413208,
+ "eval_mean_token_accuracy": 0.8489979422369669,
+ "eval_num_tokens": 5558196.0,
+ "eval_runtime": 86.2986,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 2380
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.346658566506496e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-240/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-240/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-240/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-240/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-240/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-240/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-240/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-240/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-240/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-240/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-240/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-240/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-240/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-240/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..016fbf9006bd96787a330a0eb0feef4ec2211bb8
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-240/trainer_state.json
@@ -0,0 +1,286 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 0.597758405977584,
+ "eval_steps": 20,
+ "global_step": 240,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.4041441504845824e+16,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2400/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2400/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2400/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2400/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2400/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2400/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2400/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2400/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2400/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2400/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2400/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2400/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2400/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2400/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..f446baff868d1adb48e87ff2773b52da7575130a
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2400/trainer_state.json
@@ -0,0 +1,2554 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 5.971357409713574,
+ "eval_steps": 20,
+ "global_step": 2400,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ },
+ {
+ "entropy": 0.3193941755220294,
+ "epoch": 4.5280199252802,
+ "grad_norm": 0.8281906843185425,
+ "learning_rate": 0.0001509111761786888,
+ "loss": 0.23936262130737304,
+ "mean_token_accuracy": 0.9201708927750587,
+ "num_tokens": 4244423.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.5280199252802,
+ "eval_entropy": 0.38704028864239537,
+ "eval_loss": 0.6006569266319275,
+ "eval_mean_token_accuracy": 0.8502406720505205,
+ "eval_num_tokens": 4244423.0,
+ "eval_runtime": 86.8059,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1820
+ },
+ {
+ "entropy": 0.3164879363030195,
+ "epoch": 4.577833125778331,
+ "grad_norm": 0.7892968654632568,
+ "learning_rate": 0.00014905346557909867,
+ "loss": 0.24541733264923096,
+ "mean_token_accuracy": 0.9175932116806507,
+ "num_tokens": 4289773.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.577833125778331,
+ "eval_entropy": 0.38861122120951497,
+ "eval_loss": 0.6115967631340027,
+ "eval_mean_token_accuracy": 0.849471275196519,
+ "eval_num_tokens": 4289773.0,
+ "eval_runtime": 86.2946,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1840
+ },
+ {
+ "entropy": 0.3051785985007882,
+ "epoch": 4.627646326276463,
+ "grad_norm": 0.8109654188156128,
+ "learning_rate": 0.0001471849238862319,
+ "loss": 0.23433220386505127,
+ "mean_token_accuracy": 0.9206570319831371,
+ "num_tokens": 4336894.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.627646326276463,
+ "eval_entropy": 0.37162452295076015,
+ "eval_loss": 0.6184061765670776,
+ "eval_mean_token_accuracy": 0.8501173268223918,
+ "eval_num_tokens": 4336894.0,
+ "eval_runtime": 86.6865,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1860
+ },
+ {
+ "entropy": 0.3168198253959417,
+ "epoch": 4.677459526774595,
+ "grad_norm": 0.9512342214584351,
+ "learning_rate": 0.0001453061146267775,
+ "loss": 0.23832404613494873,
+ "mean_token_accuracy": 0.9197044663131237,
+ "num_tokens": 4382947.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.677459526774595,
+ "eval_entropy": 0.3845940856912801,
+ "eval_loss": 0.606762707233429,
+ "eval_mean_token_accuracy": 0.8504838194957999,
+ "eval_num_tokens": 4382947.0,
+ "eval_runtime": 86.5175,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 1880
+ },
+ {
+ "entropy": 0.30791807882487776,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 0.8123113512992859,
+ "learning_rate": 0.00014341760442398248,
+ "loss": 0.2395785331726074,
+ "mean_token_accuracy": 0.918928150832653,
+ "num_tokens": 4433050.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.7272727272727275,
+ "eval_entropy": 0.39762327222283494,
+ "eval_loss": 0.5994202494621277,
+ "eval_mean_token_accuracy": 0.8509274201337681,
+ "eval_num_tokens": 4433050.0,
+ "eval_runtime": 86.2873,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.993,
+ "step": 1900
+ },
+ {
+ "entropy": 0.3021434534341097,
+ "epoch": 4.777085927770859,
+ "grad_norm": 0.731787383556366,
+ "learning_rate": 0.000141519962826766,
+ "loss": 0.23494718074798585,
+ "mean_token_accuracy": 0.9201403826475143,
+ "num_tokens": 4483598.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.777085927770859,
+ "eval_entropy": 0.3827026732439219,
+ "eval_loss": 0.5995895862579346,
+ "eval_mean_token_accuracy": 0.851468373523202,
+ "eval_num_tokens": 4483598.0,
+ "eval_runtime": 86.3006,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 1920
+ },
+ {
+ "entropy": 0.31626159623265265,
+ "epoch": 4.826899128268991,
+ "grad_norm": 0.8848487138748169,
+ "learning_rate": 0.00013961376213795132,
+ "loss": 0.2439030647277832,
+ "mean_token_accuracy": 0.9196575872600079,
+ "num_tokens": 4529201.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.826899128268991,
+ "eval_entropy": 0.388698436839636,
+ "eval_loss": 0.6000174283981323,
+ "eval_mean_token_accuracy": 0.8518068187458571,
+ "eval_num_tokens": 4529201.0,
+ "eval_runtime": 86.8979,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.979,
+ "step": 1940
+ },
+ {
+ "entropy": 0.30520407035946845,
+ "epoch": 4.876712328767123,
+ "grad_norm": 0.8532460927963257,
+ "learning_rate": 0.00013769957724166695,
+ "loss": 0.23458616733551024,
+ "mean_token_accuracy": 0.9221912942826748,
+ "num_tokens": 4578167.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.876712328767123,
+ "eval_entropy": 0.38777847102908203,
+ "eval_loss": 0.6004981398582458,
+ "eval_mean_token_accuracy": 0.8516481768253238,
+ "eval_num_tokens": 4578167.0,
+ "eval_runtime": 87.0777,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.975,
+ "step": 1960
+ },
+ {
+ "entropy": 0.3226448342204094,
+ "epoch": 4.926525529265255,
+ "grad_norm": 0.6945561766624451,
+ "learning_rate": 0.0001357779854299694,
+ "loss": 0.24048397541046143,
+ "mean_token_accuracy": 0.9195300146937371,
+ "num_tokens": 4622316.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.926525529265255,
+ "eval_entropy": 0.38581624263247777,
+ "eval_loss": 0.6029234528541565,
+ "eval_mean_token_accuracy": 0.8514213260523108,
+ "eval_num_tokens": 4622316.0,
+ "eval_runtime": 85.8729,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 1980
+ },
+ {
+ "entropy": 0.3051655298098922,
+ "epoch": 4.976338729763388,
+ "grad_norm": 0.7976452708244324,
+ "learning_rate": 0.00013384956622874001,
+ "loss": 0.23584742546081544,
+ "mean_token_accuracy": 0.9216851457953453,
+ "num_tokens": 4670746.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.976338729763388,
+ "eval_entropy": 0.37913159246361533,
+ "eval_loss": 0.6057604551315308,
+ "eval_mean_token_accuracy": 0.8525801203971686,
+ "eval_num_tokens": 4670746.0,
+ "eval_runtime": 86.1145,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2000
+ },
+ {
+ "entropy": 0.27438195240803254,
+ "epoch": 5.024906600249066,
+ "grad_norm": 0.6729586124420166,
+ "learning_rate": 0.0001319149012229075,
+ "loss": 0.19775952100753785,
+ "mean_token_accuracy": 0.9339428559327737,
+ "num_tokens": 4716176.0,
+ "step": 2020
+ },
+ {
+ "epoch": 5.024906600249066,
+ "eval_entropy": 0.3448961910813354,
+ "eval_loss": 0.6750120520591736,
+ "eval_mean_token_accuracy": 0.8487970232963562,
+ "eval_num_tokens": 4716176.0,
+ "eval_runtime": 86.1169,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2020
+ },
+ {
+ "entropy": 0.21423916313797237,
+ "epoch": 5.074719800747198,
+ "grad_norm": 0.6934391856193542,
+ "learning_rate": 0.00012997457388105022,
+ "loss": 0.1439570426940918,
+ "mean_token_accuracy": 0.9528236843645572,
+ "num_tokens": 4763269.0,
+ "step": 2040
+ },
+ {
+ "epoch": 5.074719800747198,
+ "eval_entropy": 0.3570949243771475,
+ "eval_loss": 0.6465504169464111,
+ "eval_mean_token_accuracy": 0.8490785547467166,
+ "eval_num_tokens": 4763269.0,
+ "eval_runtime": 85.9574,
+ "eval_samples_per_second": 15.996,
+ "eval_steps_per_second": 2.001,
+ "step": 2040
+ },
+ {
+ "entropy": 0.20838565267622472,
+ "epoch": 5.12453300124533,
+ "grad_norm": 0.7286986112594604,
+ "learning_rate": 0.00012802916937942972,
+ "loss": 0.14467307329177856,
+ "mean_token_accuracy": 0.950994835793972,
+ "num_tokens": 4809047.0,
+ "step": 2060
+ },
+ {
+ "epoch": 5.12453300124533,
+ "eval_entropy": 0.3452463157821533,
+ "eval_loss": 0.6705958843231201,
+ "eval_mean_token_accuracy": 0.8490352796953778,
+ "eval_num_tokens": 4809047.0,
+ "eval_runtime": 86.228,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 2060
+ },
+ {
+ "entropy": 0.20453082229942082,
+ "epoch": 5.174346201743462,
+ "grad_norm": 0.7515555620193481,
+ "learning_rate": 0.00012607927442550974,
+ "loss": 0.13732000589370727,
+ "mean_token_accuracy": 0.9537357829511166,
+ "num_tokens": 4857965.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.174346201743462,
+ "eval_entropy": 0.32431264914745506,
+ "eval_loss": 0.6743043065071106,
+ "eval_mean_token_accuracy": 0.8504878629085629,
+ "eval_num_tokens": 4857965.0,
+ "eval_runtime": 86.5948,
+ "eval_samples_per_second": 15.879,
+ "eval_steps_per_second": 1.986,
+ "step": 2080
+ },
+ {
+ "entropy": 0.21812320686876774,
+ "epoch": 5.224159402241594,
+ "grad_norm": 0.9093465209007263,
+ "learning_rate": 0.0001241254770810132,
+ "loss": 0.14311420917510986,
+ "mean_token_accuracy": 0.9514068141579628,
+ "num_tokens": 4905151.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.224159402241594,
+ "eval_entropy": 0.33086285835435225,
+ "eval_loss": 0.6676449179649353,
+ "eval_mean_token_accuracy": 0.8505287662495015,
+ "eval_num_tokens": 4905151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 2100
+ },
+ {
+ "entropy": 0.2180163251236081,
+ "epoch": 5.273972602739726,
+ "grad_norm": 0.6703007221221924,
+ "learning_rate": 0.00012216836658457075,
+ "loss": 0.14803968667984008,
+ "mean_token_accuracy": 0.9521303348243236,
+ "num_tokens": 4947072.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.273972602739726,
+ "eval_entropy": 0.33162341708707255,
+ "eval_loss": 0.6658875942230225,
+ "eval_mean_token_accuracy": 0.8500757605530495,
+ "eval_num_tokens": 4947072.0,
+ "eval_runtime": 86.6296,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 2120
+ },
+ {
+ "entropy": 0.22511130161583423,
+ "epoch": 5.323785803237858,
+ "grad_norm": 0.8078880906105042,
+ "learning_rate": 0.00012020853317401455,
+ "loss": 0.15228408575057983,
+ "mean_token_accuracy": 0.947144789993763,
+ "num_tokens": 4991974.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.323785803237858,
+ "eval_entropy": 0.3354601170434508,
+ "eval_loss": 0.6677829623222351,
+ "eval_mean_token_accuracy": 0.8482600024273229,
+ "eval_num_tokens": 4991974.0,
+ "eval_runtime": 86.4689,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.989,
+ "step": 2140
+ },
+ {
+ "entropy": 0.2244176059961319,
+ "epoch": 5.37359900373599,
+ "grad_norm": 0.9636075496673584,
+ "learning_rate": 0.00011824656790837037,
+ "loss": 0.15260883569717407,
+ "mean_token_accuracy": 0.9471467643976211,
+ "num_tokens": 5038400.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.37359900373599,
+ "eval_entropy": 0.3381616926297199,
+ "eval_loss": 0.6694412231445312,
+ "eval_mean_token_accuracy": 0.8482369603805764,
+ "eval_num_tokens": 5038400.0,
+ "eval_runtime": 86.4147,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 2160
+ },
+ {
+ "entropy": 0.22982364390045404,
+ "epoch": 5.423412204234122,
+ "grad_norm": 0.775401771068573,
+ "learning_rate": 0.00011628306248960262,
+ "loss": 0.15140302181243898,
+ "mean_token_accuracy": 0.9492553934454918,
+ "num_tokens": 5083166.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.423412204234122,
+ "eval_entropy": 0.3305150235808173,
+ "eval_loss": 0.6717822551727295,
+ "eval_mean_token_accuracy": 0.8489849723355715,
+ "eval_num_tokens": 5083166.0,
+ "eval_runtime": 86.4728,
+ "eval_samples_per_second": 15.901,
+ "eval_steps_per_second": 1.989,
+ "step": 2180
+ },
+ {
+ "entropy": 0.21448935717344284,
+ "epoch": 5.473225404732254,
+ "grad_norm": 0.6575281023979187,
+ "learning_rate": 0.00011431860908416465,
+ "loss": 0.1452319622039795,
+ "mean_token_accuracy": 0.9505287684500218,
+ "num_tokens": 5135109.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.473225404732254,
+ "eval_entropy": 0.3488145174328671,
+ "eval_loss": 0.6612305641174316,
+ "eval_mean_token_accuracy": 0.8492907808963642,
+ "eval_num_tokens": 5135109.0,
+ "eval_runtime": 86.6927,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 2200
+ },
+ {
+ "entropy": 0.23091202937066554,
+ "epoch": 5.523038605230386,
+ "grad_norm": 0.8909686207771301,
+ "learning_rate": 0.00011235380014440985,
+ "loss": 0.15150139331817628,
+ "mean_token_accuracy": 0.9497875183820724,
+ "num_tokens": 5180138.0,
+ "step": 2220
+ },
+ {
+ "epoch": 5.523038605230386,
+ "eval_entropy": 0.3268539015810157,
+ "eval_loss": 0.6667542457580566,
+ "eval_mean_token_accuracy": 0.8499062903398691,
+ "eval_num_tokens": 5180138.0,
+ "eval_runtime": 86.4644,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 2220
+ },
+ {
+ "entropy": 0.2227974807843566,
+ "epoch": 5.572851805728518,
+ "grad_norm": 0.6180275082588196,
+ "learning_rate": 0.0001103892282299158,
+ "loss": 0.1491069197654724,
+ "mean_token_accuracy": 0.9488144010305405,
+ "num_tokens": 5226864.0,
+ "step": 2240
+ },
+ {
+ "epoch": 5.572851805728518,
+ "eval_entropy": 0.3346347655494546,
+ "eval_loss": 0.6665948629379272,
+ "eval_mean_token_accuracy": 0.8499961893918903,
+ "eval_num_tokens": 5226864.0,
+ "eval_runtime": 87.0548,
+ "eval_samples_per_second": 15.795,
+ "eval_steps_per_second": 1.976,
+ "step": 2240
+ },
+ {
+ "entropy": 0.21368421968072654,
+ "epoch": 5.62266500622665,
+ "grad_norm": 0.6004369258880615,
+ "learning_rate": 0.00010842548582877651,
+ "loss": 0.14485255479812623,
+ "mean_token_accuracy": 0.9502056457102299,
+ "num_tokens": 5276602.0,
+ "step": 2260
+ },
+ {
+ "epoch": 5.62266500622665,
+ "eval_entropy": 0.32753298804163933,
+ "eval_loss": 0.6680151224136353,
+ "eval_mean_token_accuracy": 0.8515451086121936,
+ "eval_num_tokens": 5276602.0,
+ "eval_runtime": 86.8524,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.98,
+ "step": 2260
+ },
+ {
+ "entropy": 0.2103635374456644,
+ "epoch": 5.672478206724782,
+ "grad_norm": 0.699174702167511,
+ "learning_rate": 0.00010646316517891613,
+ "loss": 0.14297772645950318,
+ "mean_token_accuracy": 0.9512537539005279,
+ "num_tokens": 5323718.0,
+ "step": 2280
+ },
+ {
+ "epoch": 5.672478206724782,
+ "eval_entropy": 0.32966585959806,
+ "eval_loss": 0.675578773021698,
+ "eval_mean_token_accuracy": 0.8509623023659684,
+ "eval_num_tokens": 5323718.0,
+ "eval_runtime": 86.4518,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2280
+ },
+ {
+ "entropy": 0.22516900151968003,
+ "epoch": 5.722291407222914,
+ "grad_norm": 0.6637354493141174,
+ "learning_rate": 0.00010450285808947797,
+ "loss": 0.15202572345733642,
+ "mean_token_accuracy": 0.9482452072203159,
+ "num_tokens": 5369039.0,
+ "step": 2300
+ },
+ {
+ "epoch": 5.722291407222914,
+ "eval_entropy": 0.3369456917740578,
+ "eval_loss": 0.6697061061859131,
+ "eval_mean_token_accuracy": 0.848603522361711,
+ "eval_num_tokens": 5369039.0,
+ "eval_runtime": 86.6371,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.985,
+ "step": 2300
+ },
+ {
+ "entropy": 0.21841065725311637,
+ "epoch": 5.772104607721046,
+ "grad_norm": 0.7940268516540527,
+ "learning_rate": 0.00010254515576234297,
+ "loss": 0.14710167646408082,
+ "mean_token_accuracy": 0.9493498183786869,
+ "num_tokens": 5417029.0,
+ "step": 2320
+ },
+ {
+ "epoch": 5.772104607721046,
+ "eval_entropy": 0.3237486180177955,
+ "eval_loss": 0.6779657602310181,
+ "eval_mean_token_accuracy": 0.8500715313955794,
+ "eval_num_tokens": 5417029.0,
+ "eval_runtime": 86.1826,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 1.996,
+ "step": 2320
+ },
+ {
+ "entropy": 0.22146204356104135,
+ "epoch": 5.821917808219178,
+ "grad_norm": 0.9234833121299744,
+ "learning_rate": 0.00010059064861383132,
+ "loss": 0.14720046520233154,
+ "mean_token_accuracy": 0.9493872679769992,
+ "num_tokens": 5461671.0,
+ "step": 2340
+ },
+ {
+ "epoch": 5.821917808219178,
+ "eval_entropy": 0.32365207564692167,
+ "eval_loss": 0.6704005002975464,
+ "eval_mean_token_accuracy": 0.8507985760306203,
+ "eval_num_tokens": 5461671.0,
+ "eval_runtime": 86.5494,
+ "eval_samples_per_second": 15.887,
+ "eval_steps_per_second": 1.987,
+ "step": 2340
+ },
+ {
+ "entropy": 0.20934011954814197,
+ "epoch": 5.87173100871731,
+ "grad_norm": 0.5547503232955933,
+ "learning_rate": 9.863992609664084e-05,
+ "loss": 0.1464867353439331,
+ "mean_token_accuracy": 0.9503875687718392,
+ "num_tokens": 5509312.0,
+ "step": 2360
+ },
+ {
+ "epoch": 5.87173100871731,
+ "eval_entropy": 0.3330401429083458,
+ "eval_loss": 0.6659091114997864,
+ "eval_mean_token_accuracy": 0.8504848906467127,
+ "eval_num_tokens": 5509312.0,
+ "eval_runtime": 86.5855,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 2360
+ },
+ {
+ "entropy": 0.21678635366261007,
+ "epoch": 5.921544209215442,
+ "grad_norm": 0.570612907409668,
+ "learning_rate": 9.669357652207635e-05,
+ "loss": 0.14821385145187377,
+ "mean_token_accuracy": 0.9503940217196941,
+ "num_tokens": 5558196.0,
+ "step": 2380
+ },
+ {
+ "epoch": 5.921544209215442,
+ "eval_entropy": 0.3322022325077722,
+ "eval_loss": 0.6722489595413208,
+ "eval_mean_token_accuracy": 0.8489979422369669,
+ "eval_num_tokens": 5558196.0,
+ "eval_runtime": 86.2986,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 2380
+ },
+ {
+ "entropy": 0.20932920072227718,
+ "epoch": 5.971357409713574,
+ "grad_norm": 0.7879557609558105,
+ "learning_rate": 9.475218688262262e-05,
+ "loss": 0.14675841331481934,
+ "mean_token_accuracy": 0.9507176131010056,
+ "num_tokens": 5605400.0,
+ "step": 2400
+ },
+ {
+ "epoch": 5.971357409713574,
+ "eval_entropy": 0.3199348642902319,
+ "eval_loss": 0.6698136329650879,
+ "eval_mean_token_accuracy": 0.8514142130003419,
+ "eval_num_tokens": 5605400.0,
+ "eval_runtime": 85.8995,
+ "eval_samples_per_second": 16.007,
+ "eval_steps_per_second": 2.002,
+ "step": 2400
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.366798492079145e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2420/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2420/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2420/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2420/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2420/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2420/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2420/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2420/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2420/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2420/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2420/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2420/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2420/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2420/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..119910cdf1017a5d25b4fdb0e81dadb7744a736c
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2420/trainer_state.json
@@ -0,0 +1,2575 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 6.019925280199253,
+ "eval_steps": 20,
+ "global_step": 2420,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ },
+ {
+ "entropy": 0.3193941755220294,
+ "epoch": 4.5280199252802,
+ "grad_norm": 0.8281906843185425,
+ "learning_rate": 0.0001509111761786888,
+ "loss": 0.23936262130737304,
+ "mean_token_accuracy": 0.9201708927750587,
+ "num_tokens": 4244423.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.5280199252802,
+ "eval_entropy": 0.38704028864239537,
+ "eval_loss": 0.6006569266319275,
+ "eval_mean_token_accuracy": 0.8502406720505205,
+ "eval_num_tokens": 4244423.0,
+ "eval_runtime": 86.8059,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1820
+ },
+ {
+ "entropy": 0.3164879363030195,
+ "epoch": 4.577833125778331,
+ "grad_norm": 0.7892968654632568,
+ "learning_rate": 0.00014905346557909867,
+ "loss": 0.24541733264923096,
+ "mean_token_accuracy": 0.9175932116806507,
+ "num_tokens": 4289773.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.577833125778331,
+ "eval_entropy": 0.38861122120951497,
+ "eval_loss": 0.6115967631340027,
+ "eval_mean_token_accuracy": 0.849471275196519,
+ "eval_num_tokens": 4289773.0,
+ "eval_runtime": 86.2946,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1840
+ },
+ {
+ "entropy": 0.3051785985007882,
+ "epoch": 4.627646326276463,
+ "grad_norm": 0.8109654188156128,
+ "learning_rate": 0.0001471849238862319,
+ "loss": 0.23433220386505127,
+ "mean_token_accuracy": 0.9206570319831371,
+ "num_tokens": 4336894.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.627646326276463,
+ "eval_entropy": 0.37162452295076015,
+ "eval_loss": 0.6184061765670776,
+ "eval_mean_token_accuracy": 0.8501173268223918,
+ "eval_num_tokens": 4336894.0,
+ "eval_runtime": 86.6865,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1860
+ },
+ {
+ "entropy": 0.3168198253959417,
+ "epoch": 4.677459526774595,
+ "grad_norm": 0.9512342214584351,
+ "learning_rate": 0.0001453061146267775,
+ "loss": 0.23832404613494873,
+ "mean_token_accuracy": 0.9197044663131237,
+ "num_tokens": 4382947.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.677459526774595,
+ "eval_entropy": 0.3845940856912801,
+ "eval_loss": 0.606762707233429,
+ "eval_mean_token_accuracy": 0.8504838194957999,
+ "eval_num_tokens": 4382947.0,
+ "eval_runtime": 86.5175,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 1880
+ },
+ {
+ "entropy": 0.30791807882487776,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 0.8123113512992859,
+ "learning_rate": 0.00014341760442398248,
+ "loss": 0.2395785331726074,
+ "mean_token_accuracy": 0.918928150832653,
+ "num_tokens": 4433050.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.7272727272727275,
+ "eval_entropy": 0.39762327222283494,
+ "eval_loss": 0.5994202494621277,
+ "eval_mean_token_accuracy": 0.8509274201337681,
+ "eval_num_tokens": 4433050.0,
+ "eval_runtime": 86.2873,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.993,
+ "step": 1900
+ },
+ {
+ "entropy": 0.3021434534341097,
+ "epoch": 4.777085927770859,
+ "grad_norm": 0.731787383556366,
+ "learning_rate": 0.000141519962826766,
+ "loss": 0.23494718074798585,
+ "mean_token_accuracy": 0.9201403826475143,
+ "num_tokens": 4483598.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.777085927770859,
+ "eval_entropy": 0.3827026732439219,
+ "eval_loss": 0.5995895862579346,
+ "eval_mean_token_accuracy": 0.851468373523202,
+ "eval_num_tokens": 4483598.0,
+ "eval_runtime": 86.3006,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 1920
+ },
+ {
+ "entropy": 0.31626159623265265,
+ "epoch": 4.826899128268991,
+ "grad_norm": 0.8848487138748169,
+ "learning_rate": 0.00013961376213795132,
+ "loss": 0.2439030647277832,
+ "mean_token_accuracy": 0.9196575872600079,
+ "num_tokens": 4529201.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.826899128268991,
+ "eval_entropy": 0.388698436839636,
+ "eval_loss": 0.6000174283981323,
+ "eval_mean_token_accuracy": 0.8518068187458571,
+ "eval_num_tokens": 4529201.0,
+ "eval_runtime": 86.8979,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.979,
+ "step": 1940
+ },
+ {
+ "entropy": 0.30520407035946845,
+ "epoch": 4.876712328767123,
+ "grad_norm": 0.8532460927963257,
+ "learning_rate": 0.00013769957724166695,
+ "loss": 0.23458616733551024,
+ "mean_token_accuracy": 0.9221912942826748,
+ "num_tokens": 4578167.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.876712328767123,
+ "eval_entropy": 0.38777847102908203,
+ "eval_loss": 0.6004981398582458,
+ "eval_mean_token_accuracy": 0.8516481768253238,
+ "eval_num_tokens": 4578167.0,
+ "eval_runtime": 87.0777,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.975,
+ "step": 1960
+ },
+ {
+ "entropy": 0.3226448342204094,
+ "epoch": 4.926525529265255,
+ "grad_norm": 0.6945561766624451,
+ "learning_rate": 0.0001357779854299694,
+ "loss": 0.24048397541046143,
+ "mean_token_accuracy": 0.9195300146937371,
+ "num_tokens": 4622316.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.926525529265255,
+ "eval_entropy": 0.38581624263247777,
+ "eval_loss": 0.6029234528541565,
+ "eval_mean_token_accuracy": 0.8514213260523108,
+ "eval_num_tokens": 4622316.0,
+ "eval_runtime": 85.8729,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 1980
+ },
+ {
+ "entropy": 0.3051655298098922,
+ "epoch": 4.976338729763388,
+ "grad_norm": 0.7976452708244324,
+ "learning_rate": 0.00013384956622874001,
+ "loss": 0.23584742546081544,
+ "mean_token_accuracy": 0.9216851457953453,
+ "num_tokens": 4670746.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.976338729763388,
+ "eval_entropy": 0.37913159246361533,
+ "eval_loss": 0.6057604551315308,
+ "eval_mean_token_accuracy": 0.8525801203971686,
+ "eval_num_tokens": 4670746.0,
+ "eval_runtime": 86.1145,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2000
+ },
+ {
+ "entropy": 0.27438195240803254,
+ "epoch": 5.024906600249066,
+ "grad_norm": 0.6729586124420166,
+ "learning_rate": 0.0001319149012229075,
+ "loss": 0.19775952100753785,
+ "mean_token_accuracy": 0.9339428559327737,
+ "num_tokens": 4716176.0,
+ "step": 2020
+ },
+ {
+ "epoch": 5.024906600249066,
+ "eval_entropy": 0.3448961910813354,
+ "eval_loss": 0.6750120520591736,
+ "eval_mean_token_accuracy": 0.8487970232963562,
+ "eval_num_tokens": 4716176.0,
+ "eval_runtime": 86.1169,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2020
+ },
+ {
+ "entropy": 0.21423916313797237,
+ "epoch": 5.074719800747198,
+ "grad_norm": 0.6934391856193542,
+ "learning_rate": 0.00012997457388105022,
+ "loss": 0.1439570426940918,
+ "mean_token_accuracy": 0.9528236843645572,
+ "num_tokens": 4763269.0,
+ "step": 2040
+ },
+ {
+ "epoch": 5.074719800747198,
+ "eval_entropy": 0.3570949243771475,
+ "eval_loss": 0.6465504169464111,
+ "eval_mean_token_accuracy": 0.8490785547467166,
+ "eval_num_tokens": 4763269.0,
+ "eval_runtime": 85.9574,
+ "eval_samples_per_second": 15.996,
+ "eval_steps_per_second": 2.001,
+ "step": 2040
+ },
+ {
+ "entropy": 0.20838565267622472,
+ "epoch": 5.12453300124533,
+ "grad_norm": 0.7286986112594604,
+ "learning_rate": 0.00012802916937942972,
+ "loss": 0.14467307329177856,
+ "mean_token_accuracy": 0.950994835793972,
+ "num_tokens": 4809047.0,
+ "step": 2060
+ },
+ {
+ "epoch": 5.12453300124533,
+ "eval_entropy": 0.3452463157821533,
+ "eval_loss": 0.6705958843231201,
+ "eval_mean_token_accuracy": 0.8490352796953778,
+ "eval_num_tokens": 4809047.0,
+ "eval_runtime": 86.228,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 2060
+ },
+ {
+ "entropy": 0.20453082229942082,
+ "epoch": 5.174346201743462,
+ "grad_norm": 0.7515555620193481,
+ "learning_rate": 0.00012607927442550974,
+ "loss": 0.13732000589370727,
+ "mean_token_accuracy": 0.9537357829511166,
+ "num_tokens": 4857965.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.174346201743462,
+ "eval_entropy": 0.32431264914745506,
+ "eval_loss": 0.6743043065071106,
+ "eval_mean_token_accuracy": 0.8504878629085629,
+ "eval_num_tokens": 4857965.0,
+ "eval_runtime": 86.5948,
+ "eval_samples_per_second": 15.879,
+ "eval_steps_per_second": 1.986,
+ "step": 2080
+ },
+ {
+ "entropy": 0.21812320686876774,
+ "epoch": 5.224159402241594,
+ "grad_norm": 0.9093465209007263,
+ "learning_rate": 0.0001241254770810132,
+ "loss": 0.14311420917510986,
+ "mean_token_accuracy": 0.9514068141579628,
+ "num_tokens": 4905151.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.224159402241594,
+ "eval_entropy": 0.33086285835435225,
+ "eval_loss": 0.6676449179649353,
+ "eval_mean_token_accuracy": 0.8505287662495015,
+ "eval_num_tokens": 4905151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 2100
+ },
+ {
+ "entropy": 0.2180163251236081,
+ "epoch": 5.273972602739726,
+ "grad_norm": 0.6703007221221924,
+ "learning_rate": 0.00012216836658457075,
+ "loss": 0.14803968667984008,
+ "mean_token_accuracy": 0.9521303348243236,
+ "num_tokens": 4947072.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.273972602739726,
+ "eval_entropy": 0.33162341708707255,
+ "eval_loss": 0.6658875942230225,
+ "eval_mean_token_accuracy": 0.8500757605530495,
+ "eval_num_tokens": 4947072.0,
+ "eval_runtime": 86.6296,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 2120
+ },
+ {
+ "entropy": 0.22511130161583423,
+ "epoch": 5.323785803237858,
+ "grad_norm": 0.8078880906105042,
+ "learning_rate": 0.00012020853317401455,
+ "loss": 0.15228408575057983,
+ "mean_token_accuracy": 0.947144789993763,
+ "num_tokens": 4991974.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.323785803237858,
+ "eval_entropy": 0.3354601170434508,
+ "eval_loss": 0.6677829623222351,
+ "eval_mean_token_accuracy": 0.8482600024273229,
+ "eval_num_tokens": 4991974.0,
+ "eval_runtime": 86.4689,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.989,
+ "step": 2140
+ },
+ {
+ "entropy": 0.2244176059961319,
+ "epoch": 5.37359900373599,
+ "grad_norm": 0.9636075496673584,
+ "learning_rate": 0.00011824656790837037,
+ "loss": 0.15260883569717407,
+ "mean_token_accuracy": 0.9471467643976211,
+ "num_tokens": 5038400.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.37359900373599,
+ "eval_entropy": 0.3381616926297199,
+ "eval_loss": 0.6694412231445312,
+ "eval_mean_token_accuracy": 0.8482369603805764,
+ "eval_num_tokens": 5038400.0,
+ "eval_runtime": 86.4147,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 2160
+ },
+ {
+ "entropy": 0.22982364390045404,
+ "epoch": 5.423412204234122,
+ "grad_norm": 0.775401771068573,
+ "learning_rate": 0.00011628306248960262,
+ "loss": 0.15140302181243898,
+ "mean_token_accuracy": 0.9492553934454918,
+ "num_tokens": 5083166.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.423412204234122,
+ "eval_entropy": 0.3305150235808173,
+ "eval_loss": 0.6717822551727295,
+ "eval_mean_token_accuracy": 0.8489849723355715,
+ "eval_num_tokens": 5083166.0,
+ "eval_runtime": 86.4728,
+ "eval_samples_per_second": 15.901,
+ "eval_steps_per_second": 1.989,
+ "step": 2180
+ },
+ {
+ "entropy": 0.21448935717344284,
+ "epoch": 5.473225404732254,
+ "grad_norm": 0.6575281023979187,
+ "learning_rate": 0.00011431860908416465,
+ "loss": 0.1452319622039795,
+ "mean_token_accuracy": 0.9505287684500218,
+ "num_tokens": 5135109.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.473225404732254,
+ "eval_entropy": 0.3488145174328671,
+ "eval_loss": 0.6612305641174316,
+ "eval_mean_token_accuracy": 0.8492907808963642,
+ "eval_num_tokens": 5135109.0,
+ "eval_runtime": 86.6927,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 2200
+ },
+ {
+ "entropy": 0.23091202937066554,
+ "epoch": 5.523038605230386,
+ "grad_norm": 0.8909686207771301,
+ "learning_rate": 0.00011235380014440985,
+ "loss": 0.15150139331817628,
+ "mean_token_accuracy": 0.9497875183820724,
+ "num_tokens": 5180138.0,
+ "step": 2220
+ },
+ {
+ "epoch": 5.523038605230386,
+ "eval_entropy": 0.3268539015810157,
+ "eval_loss": 0.6667542457580566,
+ "eval_mean_token_accuracy": 0.8499062903398691,
+ "eval_num_tokens": 5180138.0,
+ "eval_runtime": 86.4644,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 2220
+ },
+ {
+ "entropy": 0.2227974807843566,
+ "epoch": 5.572851805728518,
+ "grad_norm": 0.6180275082588196,
+ "learning_rate": 0.0001103892282299158,
+ "loss": 0.1491069197654724,
+ "mean_token_accuracy": 0.9488144010305405,
+ "num_tokens": 5226864.0,
+ "step": 2240
+ },
+ {
+ "epoch": 5.572851805728518,
+ "eval_entropy": 0.3346347655494546,
+ "eval_loss": 0.6665948629379272,
+ "eval_mean_token_accuracy": 0.8499961893918903,
+ "eval_num_tokens": 5226864.0,
+ "eval_runtime": 87.0548,
+ "eval_samples_per_second": 15.795,
+ "eval_steps_per_second": 1.976,
+ "step": 2240
+ },
+ {
+ "entropy": 0.21368421968072654,
+ "epoch": 5.62266500622665,
+ "grad_norm": 0.6004369258880615,
+ "learning_rate": 0.00010842548582877651,
+ "loss": 0.14485255479812623,
+ "mean_token_accuracy": 0.9502056457102299,
+ "num_tokens": 5276602.0,
+ "step": 2260
+ },
+ {
+ "epoch": 5.62266500622665,
+ "eval_entropy": 0.32753298804163933,
+ "eval_loss": 0.6680151224136353,
+ "eval_mean_token_accuracy": 0.8515451086121936,
+ "eval_num_tokens": 5276602.0,
+ "eval_runtime": 86.8524,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.98,
+ "step": 2260
+ },
+ {
+ "entropy": 0.2103635374456644,
+ "epoch": 5.672478206724782,
+ "grad_norm": 0.699174702167511,
+ "learning_rate": 0.00010646316517891613,
+ "loss": 0.14297772645950318,
+ "mean_token_accuracy": 0.9512537539005279,
+ "num_tokens": 5323718.0,
+ "step": 2280
+ },
+ {
+ "epoch": 5.672478206724782,
+ "eval_entropy": 0.32966585959806,
+ "eval_loss": 0.675578773021698,
+ "eval_mean_token_accuracy": 0.8509623023659684,
+ "eval_num_tokens": 5323718.0,
+ "eval_runtime": 86.4518,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2280
+ },
+ {
+ "entropy": 0.22516900151968003,
+ "epoch": 5.722291407222914,
+ "grad_norm": 0.6637354493141174,
+ "learning_rate": 0.00010450285808947797,
+ "loss": 0.15202572345733642,
+ "mean_token_accuracy": 0.9482452072203159,
+ "num_tokens": 5369039.0,
+ "step": 2300
+ },
+ {
+ "epoch": 5.722291407222914,
+ "eval_entropy": 0.3369456917740578,
+ "eval_loss": 0.6697061061859131,
+ "eval_mean_token_accuracy": 0.848603522361711,
+ "eval_num_tokens": 5369039.0,
+ "eval_runtime": 86.6371,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.985,
+ "step": 2300
+ },
+ {
+ "entropy": 0.21841065725311637,
+ "epoch": 5.772104607721046,
+ "grad_norm": 0.7940268516540527,
+ "learning_rate": 0.00010254515576234297,
+ "loss": 0.14710167646408082,
+ "mean_token_accuracy": 0.9493498183786869,
+ "num_tokens": 5417029.0,
+ "step": 2320
+ },
+ {
+ "epoch": 5.772104607721046,
+ "eval_entropy": 0.3237486180177955,
+ "eval_loss": 0.6779657602310181,
+ "eval_mean_token_accuracy": 0.8500715313955794,
+ "eval_num_tokens": 5417029.0,
+ "eval_runtime": 86.1826,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 1.996,
+ "step": 2320
+ },
+ {
+ "entropy": 0.22146204356104135,
+ "epoch": 5.821917808219178,
+ "grad_norm": 0.9234833121299744,
+ "learning_rate": 0.00010059064861383132,
+ "loss": 0.14720046520233154,
+ "mean_token_accuracy": 0.9493872679769992,
+ "num_tokens": 5461671.0,
+ "step": 2340
+ },
+ {
+ "epoch": 5.821917808219178,
+ "eval_entropy": 0.32365207564692167,
+ "eval_loss": 0.6704005002975464,
+ "eval_mean_token_accuracy": 0.8507985760306203,
+ "eval_num_tokens": 5461671.0,
+ "eval_runtime": 86.5494,
+ "eval_samples_per_second": 15.887,
+ "eval_steps_per_second": 1.987,
+ "step": 2340
+ },
+ {
+ "entropy": 0.20934011954814197,
+ "epoch": 5.87173100871731,
+ "grad_norm": 0.5547503232955933,
+ "learning_rate": 9.863992609664084e-05,
+ "loss": 0.1464867353439331,
+ "mean_token_accuracy": 0.9503875687718392,
+ "num_tokens": 5509312.0,
+ "step": 2360
+ },
+ {
+ "epoch": 5.87173100871731,
+ "eval_entropy": 0.3330401429083458,
+ "eval_loss": 0.6659091114997864,
+ "eval_mean_token_accuracy": 0.8504848906467127,
+ "eval_num_tokens": 5509312.0,
+ "eval_runtime": 86.5855,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 2360
+ },
+ {
+ "entropy": 0.21678635366261007,
+ "epoch": 5.921544209215442,
+ "grad_norm": 0.570612907409668,
+ "learning_rate": 9.669357652207635e-05,
+ "loss": 0.14821385145187377,
+ "mean_token_accuracy": 0.9503940217196941,
+ "num_tokens": 5558196.0,
+ "step": 2380
+ },
+ {
+ "epoch": 5.921544209215442,
+ "eval_entropy": 0.3322022325077722,
+ "eval_loss": 0.6722489595413208,
+ "eval_mean_token_accuracy": 0.8489979422369669,
+ "eval_num_tokens": 5558196.0,
+ "eval_runtime": 86.2986,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 2380
+ },
+ {
+ "entropy": 0.20932920072227718,
+ "epoch": 5.971357409713574,
+ "grad_norm": 0.7879557609558105,
+ "learning_rate": 9.475218688262262e-05,
+ "loss": 0.14675841331481934,
+ "mean_token_accuracy": 0.9507176131010056,
+ "num_tokens": 5605400.0,
+ "step": 2400
+ },
+ {
+ "epoch": 5.971357409713574,
+ "eval_entropy": 0.3199348642902319,
+ "eval_loss": 0.6698136329650879,
+ "eval_mean_token_accuracy": 0.8514142130003419,
+ "eval_num_tokens": 5605400.0,
+ "eval_runtime": 85.8995,
+ "eval_samples_per_second": 16.007,
+ "eval_steps_per_second": 2.002,
+ "step": 2400
+ },
+ {
+ "entropy": 0.21032143919131693,
+ "epoch": 6.019925280199253,
+ "grad_norm": 0.5823076367378235,
+ "learning_rate": 9.281634267491569e-05,
+ "loss": 0.13322267532348633,
+ "mean_token_accuracy": 0.9550939072401096,
+ "num_tokens": 5648968.0,
+ "step": 2420
+ },
+ {
+ "epoch": 6.019925280199253,
+ "eval_entropy": 0.30206270117399303,
+ "eval_loss": 0.7093168497085571,
+ "eval_mean_token_accuracy": 0.8500627639681794,
+ "eval_num_tokens": 5648968.0,
+ "eval_runtime": 85.8128,
+ "eval_samples_per_second": 16.023,
+ "eval_steps_per_second": 2.004,
+ "step": 2420
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.385955790701056e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2440/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2440/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2440/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2440/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2440/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2440/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2440/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2440/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2440/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2440/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2440/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2440/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2440/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2440/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..76467d99bb2bd731a48fd29afdb8ce3ea50681e9
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2440/trainer_state.json
@@ -0,0 +1,2596 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 6.069738480697385,
+ "eval_steps": 20,
+ "global_step": 2440,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ },
+ {
+ "entropy": 0.3193941755220294,
+ "epoch": 4.5280199252802,
+ "grad_norm": 0.8281906843185425,
+ "learning_rate": 0.0001509111761786888,
+ "loss": 0.23936262130737304,
+ "mean_token_accuracy": 0.9201708927750587,
+ "num_tokens": 4244423.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.5280199252802,
+ "eval_entropy": 0.38704028864239537,
+ "eval_loss": 0.6006569266319275,
+ "eval_mean_token_accuracy": 0.8502406720505205,
+ "eval_num_tokens": 4244423.0,
+ "eval_runtime": 86.8059,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1820
+ },
+ {
+ "entropy": 0.3164879363030195,
+ "epoch": 4.577833125778331,
+ "grad_norm": 0.7892968654632568,
+ "learning_rate": 0.00014905346557909867,
+ "loss": 0.24541733264923096,
+ "mean_token_accuracy": 0.9175932116806507,
+ "num_tokens": 4289773.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.577833125778331,
+ "eval_entropy": 0.38861122120951497,
+ "eval_loss": 0.6115967631340027,
+ "eval_mean_token_accuracy": 0.849471275196519,
+ "eval_num_tokens": 4289773.0,
+ "eval_runtime": 86.2946,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1840
+ },
+ {
+ "entropy": 0.3051785985007882,
+ "epoch": 4.627646326276463,
+ "grad_norm": 0.8109654188156128,
+ "learning_rate": 0.0001471849238862319,
+ "loss": 0.23433220386505127,
+ "mean_token_accuracy": 0.9206570319831371,
+ "num_tokens": 4336894.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.627646326276463,
+ "eval_entropy": 0.37162452295076015,
+ "eval_loss": 0.6184061765670776,
+ "eval_mean_token_accuracy": 0.8501173268223918,
+ "eval_num_tokens": 4336894.0,
+ "eval_runtime": 86.6865,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1860
+ },
+ {
+ "entropy": 0.3168198253959417,
+ "epoch": 4.677459526774595,
+ "grad_norm": 0.9512342214584351,
+ "learning_rate": 0.0001453061146267775,
+ "loss": 0.23832404613494873,
+ "mean_token_accuracy": 0.9197044663131237,
+ "num_tokens": 4382947.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.677459526774595,
+ "eval_entropy": 0.3845940856912801,
+ "eval_loss": 0.606762707233429,
+ "eval_mean_token_accuracy": 0.8504838194957999,
+ "eval_num_tokens": 4382947.0,
+ "eval_runtime": 86.5175,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 1880
+ },
+ {
+ "entropy": 0.30791807882487776,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 0.8123113512992859,
+ "learning_rate": 0.00014341760442398248,
+ "loss": 0.2395785331726074,
+ "mean_token_accuracy": 0.918928150832653,
+ "num_tokens": 4433050.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.7272727272727275,
+ "eval_entropy": 0.39762327222283494,
+ "eval_loss": 0.5994202494621277,
+ "eval_mean_token_accuracy": 0.8509274201337681,
+ "eval_num_tokens": 4433050.0,
+ "eval_runtime": 86.2873,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.993,
+ "step": 1900
+ },
+ {
+ "entropy": 0.3021434534341097,
+ "epoch": 4.777085927770859,
+ "grad_norm": 0.731787383556366,
+ "learning_rate": 0.000141519962826766,
+ "loss": 0.23494718074798585,
+ "mean_token_accuracy": 0.9201403826475143,
+ "num_tokens": 4483598.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.777085927770859,
+ "eval_entropy": 0.3827026732439219,
+ "eval_loss": 0.5995895862579346,
+ "eval_mean_token_accuracy": 0.851468373523202,
+ "eval_num_tokens": 4483598.0,
+ "eval_runtime": 86.3006,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 1920
+ },
+ {
+ "entropy": 0.31626159623265265,
+ "epoch": 4.826899128268991,
+ "grad_norm": 0.8848487138748169,
+ "learning_rate": 0.00013961376213795132,
+ "loss": 0.2439030647277832,
+ "mean_token_accuracy": 0.9196575872600079,
+ "num_tokens": 4529201.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.826899128268991,
+ "eval_entropy": 0.388698436839636,
+ "eval_loss": 0.6000174283981323,
+ "eval_mean_token_accuracy": 0.8518068187458571,
+ "eval_num_tokens": 4529201.0,
+ "eval_runtime": 86.8979,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.979,
+ "step": 1940
+ },
+ {
+ "entropy": 0.30520407035946845,
+ "epoch": 4.876712328767123,
+ "grad_norm": 0.8532460927963257,
+ "learning_rate": 0.00013769957724166695,
+ "loss": 0.23458616733551024,
+ "mean_token_accuracy": 0.9221912942826748,
+ "num_tokens": 4578167.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.876712328767123,
+ "eval_entropy": 0.38777847102908203,
+ "eval_loss": 0.6004981398582458,
+ "eval_mean_token_accuracy": 0.8516481768253238,
+ "eval_num_tokens": 4578167.0,
+ "eval_runtime": 87.0777,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.975,
+ "step": 1960
+ },
+ {
+ "entropy": 0.3226448342204094,
+ "epoch": 4.926525529265255,
+ "grad_norm": 0.6945561766624451,
+ "learning_rate": 0.0001357779854299694,
+ "loss": 0.24048397541046143,
+ "mean_token_accuracy": 0.9195300146937371,
+ "num_tokens": 4622316.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.926525529265255,
+ "eval_entropy": 0.38581624263247777,
+ "eval_loss": 0.6029234528541565,
+ "eval_mean_token_accuracy": 0.8514213260523108,
+ "eval_num_tokens": 4622316.0,
+ "eval_runtime": 85.8729,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 1980
+ },
+ {
+ "entropy": 0.3051655298098922,
+ "epoch": 4.976338729763388,
+ "grad_norm": 0.7976452708244324,
+ "learning_rate": 0.00013384956622874001,
+ "loss": 0.23584742546081544,
+ "mean_token_accuracy": 0.9216851457953453,
+ "num_tokens": 4670746.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.976338729763388,
+ "eval_entropy": 0.37913159246361533,
+ "eval_loss": 0.6057604551315308,
+ "eval_mean_token_accuracy": 0.8525801203971686,
+ "eval_num_tokens": 4670746.0,
+ "eval_runtime": 86.1145,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2000
+ },
+ {
+ "entropy": 0.27438195240803254,
+ "epoch": 5.024906600249066,
+ "grad_norm": 0.6729586124420166,
+ "learning_rate": 0.0001319149012229075,
+ "loss": 0.19775952100753785,
+ "mean_token_accuracy": 0.9339428559327737,
+ "num_tokens": 4716176.0,
+ "step": 2020
+ },
+ {
+ "epoch": 5.024906600249066,
+ "eval_entropy": 0.3448961910813354,
+ "eval_loss": 0.6750120520591736,
+ "eval_mean_token_accuracy": 0.8487970232963562,
+ "eval_num_tokens": 4716176.0,
+ "eval_runtime": 86.1169,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2020
+ },
+ {
+ "entropy": 0.21423916313797237,
+ "epoch": 5.074719800747198,
+ "grad_norm": 0.6934391856193542,
+ "learning_rate": 0.00012997457388105022,
+ "loss": 0.1439570426940918,
+ "mean_token_accuracy": 0.9528236843645572,
+ "num_tokens": 4763269.0,
+ "step": 2040
+ },
+ {
+ "epoch": 5.074719800747198,
+ "eval_entropy": 0.3570949243771475,
+ "eval_loss": 0.6465504169464111,
+ "eval_mean_token_accuracy": 0.8490785547467166,
+ "eval_num_tokens": 4763269.0,
+ "eval_runtime": 85.9574,
+ "eval_samples_per_second": 15.996,
+ "eval_steps_per_second": 2.001,
+ "step": 2040
+ },
+ {
+ "entropy": 0.20838565267622472,
+ "epoch": 5.12453300124533,
+ "grad_norm": 0.7286986112594604,
+ "learning_rate": 0.00012802916937942972,
+ "loss": 0.14467307329177856,
+ "mean_token_accuracy": 0.950994835793972,
+ "num_tokens": 4809047.0,
+ "step": 2060
+ },
+ {
+ "epoch": 5.12453300124533,
+ "eval_entropy": 0.3452463157821533,
+ "eval_loss": 0.6705958843231201,
+ "eval_mean_token_accuracy": 0.8490352796953778,
+ "eval_num_tokens": 4809047.0,
+ "eval_runtime": 86.228,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 2060
+ },
+ {
+ "entropy": 0.20453082229942082,
+ "epoch": 5.174346201743462,
+ "grad_norm": 0.7515555620193481,
+ "learning_rate": 0.00012607927442550974,
+ "loss": 0.13732000589370727,
+ "mean_token_accuracy": 0.9537357829511166,
+ "num_tokens": 4857965.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.174346201743462,
+ "eval_entropy": 0.32431264914745506,
+ "eval_loss": 0.6743043065071106,
+ "eval_mean_token_accuracy": 0.8504878629085629,
+ "eval_num_tokens": 4857965.0,
+ "eval_runtime": 86.5948,
+ "eval_samples_per_second": 15.879,
+ "eval_steps_per_second": 1.986,
+ "step": 2080
+ },
+ {
+ "entropy": 0.21812320686876774,
+ "epoch": 5.224159402241594,
+ "grad_norm": 0.9093465209007263,
+ "learning_rate": 0.0001241254770810132,
+ "loss": 0.14311420917510986,
+ "mean_token_accuracy": 0.9514068141579628,
+ "num_tokens": 4905151.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.224159402241594,
+ "eval_entropy": 0.33086285835435225,
+ "eval_loss": 0.6676449179649353,
+ "eval_mean_token_accuracy": 0.8505287662495015,
+ "eval_num_tokens": 4905151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 2100
+ },
+ {
+ "entropy": 0.2180163251236081,
+ "epoch": 5.273972602739726,
+ "grad_norm": 0.6703007221221924,
+ "learning_rate": 0.00012216836658457075,
+ "loss": 0.14803968667984008,
+ "mean_token_accuracy": 0.9521303348243236,
+ "num_tokens": 4947072.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.273972602739726,
+ "eval_entropy": 0.33162341708707255,
+ "eval_loss": 0.6658875942230225,
+ "eval_mean_token_accuracy": 0.8500757605530495,
+ "eval_num_tokens": 4947072.0,
+ "eval_runtime": 86.6296,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 2120
+ },
+ {
+ "entropy": 0.22511130161583423,
+ "epoch": 5.323785803237858,
+ "grad_norm": 0.8078880906105042,
+ "learning_rate": 0.00012020853317401455,
+ "loss": 0.15228408575057983,
+ "mean_token_accuracy": 0.947144789993763,
+ "num_tokens": 4991974.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.323785803237858,
+ "eval_entropy": 0.3354601170434508,
+ "eval_loss": 0.6677829623222351,
+ "eval_mean_token_accuracy": 0.8482600024273229,
+ "eval_num_tokens": 4991974.0,
+ "eval_runtime": 86.4689,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.989,
+ "step": 2140
+ },
+ {
+ "entropy": 0.2244176059961319,
+ "epoch": 5.37359900373599,
+ "grad_norm": 0.9636075496673584,
+ "learning_rate": 0.00011824656790837037,
+ "loss": 0.15260883569717407,
+ "mean_token_accuracy": 0.9471467643976211,
+ "num_tokens": 5038400.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.37359900373599,
+ "eval_entropy": 0.3381616926297199,
+ "eval_loss": 0.6694412231445312,
+ "eval_mean_token_accuracy": 0.8482369603805764,
+ "eval_num_tokens": 5038400.0,
+ "eval_runtime": 86.4147,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 2160
+ },
+ {
+ "entropy": 0.22982364390045404,
+ "epoch": 5.423412204234122,
+ "grad_norm": 0.775401771068573,
+ "learning_rate": 0.00011628306248960262,
+ "loss": 0.15140302181243898,
+ "mean_token_accuracy": 0.9492553934454918,
+ "num_tokens": 5083166.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.423412204234122,
+ "eval_entropy": 0.3305150235808173,
+ "eval_loss": 0.6717822551727295,
+ "eval_mean_token_accuracy": 0.8489849723355715,
+ "eval_num_tokens": 5083166.0,
+ "eval_runtime": 86.4728,
+ "eval_samples_per_second": 15.901,
+ "eval_steps_per_second": 1.989,
+ "step": 2180
+ },
+ {
+ "entropy": 0.21448935717344284,
+ "epoch": 5.473225404732254,
+ "grad_norm": 0.6575281023979187,
+ "learning_rate": 0.00011431860908416465,
+ "loss": 0.1452319622039795,
+ "mean_token_accuracy": 0.9505287684500218,
+ "num_tokens": 5135109.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.473225404732254,
+ "eval_entropy": 0.3488145174328671,
+ "eval_loss": 0.6612305641174316,
+ "eval_mean_token_accuracy": 0.8492907808963642,
+ "eval_num_tokens": 5135109.0,
+ "eval_runtime": 86.6927,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 2200
+ },
+ {
+ "entropy": 0.23091202937066554,
+ "epoch": 5.523038605230386,
+ "grad_norm": 0.8909686207771301,
+ "learning_rate": 0.00011235380014440985,
+ "loss": 0.15150139331817628,
+ "mean_token_accuracy": 0.9497875183820724,
+ "num_tokens": 5180138.0,
+ "step": 2220
+ },
+ {
+ "epoch": 5.523038605230386,
+ "eval_entropy": 0.3268539015810157,
+ "eval_loss": 0.6667542457580566,
+ "eval_mean_token_accuracy": 0.8499062903398691,
+ "eval_num_tokens": 5180138.0,
+ "eval_runtime": 86.4644,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 2220
+ },
+ {
+ "entropy": 0.2227974807843566,
+ "epoch": 5.572851805728518,
+ "grad_norm": 0.6180275082588196,
+ "learning_rate": 0.0001103892282299158,
+ "loss": 0.1491069197654724,
+ "mean_token_accuracy": 0.9488144010305405,
+ "num_tokens": 5226864.0,
+ "step": 2240
+ },
+ {
+ "epoch": 5.572851805728518,
+ "eval_entropy": 0.3346347655494546,
+ "eval_loss": 0.6665948629379272,
+ "eval_mean_token_accuracy": 0.8499961893918903,
+ "eval_num_tokens": 5226864.0,
+ "eval_runtime": 87.0548,
+ "eval_samples_per_second": 15.795,
+ "eval_steps_per_second": 1.976,
+ "step": 2240
+ },
+ {
+ "entropy": 0.21368421968072654,
+ "epoch": 5.62266500622665,
+ "grad_norm": 0.6004369258880615,
+ "learning_rate": 0.00010842548582877651,
+ "loss": 0.14485255479812623,
+ "mean_token_accuracy": 0.9502056457102299,
+ "num_tokens": 5276602.0,
+ "step": 2260
+ },
+ {
+ "epoch": 5.62266500622665,
+ "eval_entropy": 0.32753298804163933,
+ "eval_loss": 0.6680151224136353,
+ "eval_mean_token_accuracy": 0.8515451086121936,
+ "eval_num_tokens": 5276602.0,
+ "eval_runtime": 86.8524,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.98,
+ "step": 2260
+ },
+ {
+ "entropy": 0.2103635374456644,
+ "epoch": 5.672478206724782,
+ "grad_norm": 0.699174702167511,
+ "learning_rate": 0.00010646316517891613,
+ "loss": 0.14297772645950318,
+ "mean_token_accuracy": 0.9512537539005279,
+ "num_tokens": 5323718.0,
+ "step": 2280
+ },
+ {
+ "epoch": 5.672478206724782,
+ "eval_entropy": 0.32966585959806,
+ "eval_loss": 0.675578773021698,
+ "eval_mean_token_accuracy": 0.8509623023659684,
+ "eval_num_tokens": 5323718.0,
+ "eval_runtime": 86.4518,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2280
+ },
+ {
+ "entropy": 0.22516900151968003,
+ "epoch": 5.722291407222914,
+ "grad_norm": 0.6637354493141174,
+ "learning_rate": 0.00010450285808947797,
+ "loss": 0.15202572345733642,
+ "mean_token_accuracy": 0.9482452072203159,
+ "num_tokens": 5369039.0,
+ "step": 2300
+ },
+ {
+ "epoch": 5.722291407222914,
+ "eval_entropy": 0.3369456917740578,
+ "eval_loss": 0.6697061061859131,
+ "eval_mean_token_accuracy": 0.848603522361711,
+ "eval_num_tokens": 5369039.0,
+ "eval_runtime": 86.6371,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.985,
+ "step": 2300
+ },
+ {
+ "entropy": 0.21841065725311637,
+ "epoch": 5.772104607721046,
+ "grad_norm": 0.7940268516540527,
+ "learning_rate": 0.00010254515576234297,
+ "loss": 0.14710167646408082,
+ "mean_token_accuracy": 0.9493498183786869,
+ "num_tokens": 5417029.0,
+ "step": 2320
+ },
+ {
+ "epoch": 5.772104607721046,
+ "eval_entropy": 0.3237486180177955,
+ "eval_loss": 0.6779657602310181,
+ "eval_mean_token_accuracy": 0.8500715313955794,
+ "eval_num_tokens": 5417029.0,
+ "eval_runtime": 86.1826,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 1.996,
+ "step": 2320
+ },
+ {
+ "entropy": 0.22146204356104135,
+ "epoch": 5.821917808219178,
+ "grad_norm": 0.9234833121299744,
+ "learning_rate": 0.00010059064861383132,
+ "loss": 0.14720046520233154,
+ "mean_token_accuracy": 0.9493872679769992,
+ "num_tokens": 5461671.0,
+ "step": 2340
+ },
+ {
+ "epoch": 5.821917808219178,
+ "eval_entropy": 0.32365207564692167,
+ "eval_loss": 0.6704005002975464,
+ "eval_mean_token_accuracy": 0.8507985760306203,
+ "eval_num_tokens": 5461671.0,
+ "eval_runtime": 86.5494,
+ "eval_samples_per_second": 15.887,
+ "eval_steps_per_second": 1.987,
+ "step": 2340
+ },
+ {
+ "entropy": 0.20934011954814197,
+ "epoch": 5.87173100871731,
+ "grad_norm": 0.5547503232955933,
+ "learning_rate": 9.863992609664084e-05,
+ "loss": 0.1464867353439331,
+ "mean_token_accuracy": 0.9503875687718392,
+ "num_tokens": 5509312.0,
+ "step": 2360
+ },
+ {
+ "epoch": 5.87173100871731,
+ "eval_entropy": 0.3330401429083458,
+ "eval_loss": 0.6659091114997864,
+ "eval_mean_token_accuracy": 0.8504848906467127,
+ "eval_num_tokens": 5509312.0,
+ "eval_runtime": 86.5855,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 2360
+ },
+ {
+ "entropy": 0.21678635366261007,
+ "epoch": 5.921544209215442,
+ "grad_norm": 0.570612907409668,
+ "learning_rate": 9.669357652207635e-05,
+ "loss": 0.14821385145187377,
+ "mean_token_accuracy": 0.9503940217196941,
+ "num_tokens": 5558196.0,
+ "step": 2380
+ },
+ {
+ "epoch": 5.921544209215442,
+ "eval_entropy": 0.3322022325077722,
+ "eval_loss": 0.6722489595413208,
+ "eval_mean_token_accuracy": 0.8489979422369669,
+ "eval_num_tokens": 5558196.0,
+ "eval_runtime": 86.2986,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 2380
+ },
+ {
+ "entropy": 0.20932920072227718,
+ "epoch": 5.971357409713574,
+ "grad_norm": 0.7879557609558105,
+ "learning_rate": 9.475218688262262e-05,
+ "loss": 0.14675841331481934,
+ "mean_token_accuracy": 0.9507176131010056,
+ "num_tokens": 5605400.0,
+ "step": 2400
+ },
+ {
+ "epoch": 5.971357409713574,
+ "eval_entropy": 0.3199348642902319,
+ "eval_loss": 0.6698136329650879,
+ "eval_mean_token_accuracy": 0.8514142130003419,
+ "eval_num_tokens": 5605400.0,
+ "eval_runtime": 85.8995,
+ "eval_samples_per_second": 16.007,
+ "eval_steps_per_second": 2.002,
+ "step": 2400
+ },
+ {
+ "entropy": 0.21032143919131693,
+ "epoch": 6.019925280199253,
+ "grad_norm": 0.5823076367378235,
+ "learning_rate": 9.281634267491569e-05,
+ "loss": 0.13322267532348633,
+ "mean_token_accuracy": 0.9550939072401096,
+ "num_tokens": 5648968.0,
+ "step": 2420
+ },
+ {
+ "epoch": 6.019925280199253,
+ "eval_entropy": 0.30206270117399303,
+ "eval_loss": 0.7093168497085571,
+ "eval_mean_token_accuracy": 0.8500627639681794,
+ "eval_num_tokens": 5648968.0,
+ "eval_runtime": 85.8128,
+ "eval_samples_per_second": 16.023,
+ "eval_steps_per_second": 2.004,
+ "step": 2420
+ },
+ {
+ "entropy": 0.1534628233872354,
+ "epoch": 6.069738480697385,
+ "grad_norm": 0.710133969783783,
+ "learning_rate": 9.088662772316508e-05,
+ "loss": 0.09078952670097351,
+ "mean_token_accuracy": 0.9678447999060154,
+ "num_tokens": 5697633.0,
+ "step": 2440
+ },
+ {
+ "epoch": 6.069738480697385,
+ "eval_entropy": 0.28208133101809857,
+ "eval_loss": 0.7636417150497437,
+ "eval_mean_token_accuracy": 0.8494061477655588,
+ "eval_num_tokens": 5697633.0,
+ "eval_runtime": 85.9724,
+ "eval_samples_per_second": 15.994,
+ "eval_steps_per_second": 2.001,
+ "step": 2440
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.4063452438300467e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2460/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2460/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2460/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2460/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2460/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2460/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2460/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2460/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2460/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2460/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2460/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2460/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2460/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2460/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..cf203354a81fb40d769d28bc2ddb5d9adf416b2f
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2460/trainer_state.json
@@ -0,0 +1,2617 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 6.119551681195516,
+ "eval_steps": 20,
+ "global_step": 2460,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ },
+ {
+ "entropy": 0.3193941755220294,
+ "epoch": 4.5280199252802,
+ "grad_norm": 0.8281906843185425,
+ "learning_rate": 0.0001509111761786888,
+ "loss": 0.23936262130737304,
+ "mean_token_accuracy": 0.9201708927750587,
+ "num_tokens": 4244423.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.5280199252802,
+ "eval_entropy": 0.38704028864239537,
+ "eval_loss": 0.6006569266319275,
+ "eval_mean_token_accuracy": 0.8502406720505205,
+ "eval_num_tokens": 4244423.0,
+ "eval_runtime": 86.8059,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1820
+ },
+ {
+ "entropy": 0.3164879363030195,
+ "epoch": 4.577833125778331,
+ "grad_norm": 0.7892968654632568,
+ "learning_rate": 0.00014905346557909867,
+ "loss": 0.24541733264923096,
+ "mean_token_accuracy": 0.9175932116806507,
+ "num_tokens": 4289773.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.577833125778331,
+ "eval_entropy": 0.38861122120951497,
+ "eval_loss": 0.6115967631340027,
+ "eval_mean_token_accuracy": 0.849471275196519,
+ "eval_num_tokens": 4289773.0,
+ "eval_runtime": 86.2946,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1840
+ },
+ {
+ "entropy": 0.3051785985007882,
+ "epoch": 4.627646326276463,
+ "grad_norm": 0.8109654188156128,
+ "learning_rate": 0.0001471849238862319,
+ "loss": 0.23433220386505127,
+ "mean_token_accuracy": 0.9206570319831371,
+ "num_tokens": 4336894.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.627646326276463,
+ "eval_entropy": 0.37162452295076015,
+ "eval_loss": 0.6184061765670776,
+ "eval_mean_token_accuracy": 0.8501173268223918,
+ "eval_num_tokens": 4336894.0,
+ "eval_runtime": 86.6865,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1860
+ },
+ {
+ "entropy": 0.3168198253959417,
+ "epoch": 4.677459526774595,
+ "grad_norm": 0.9512342214584351,
+ "learning_rate": 0.0001453061146267775,
+ "loss": 0.23832404613494873,
+ "mean_token_accuracy": 0.9197044663131237,
+ "num_tokens": 4382947.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.677459526774595,
+ "eval_entropy": 0.3845940856912801,
+ "eval_loss": 0.606762707233429,
+ "eval_mean_token_accuracy": 0.8504838194957999,
+ "eval_num_tokens": 4382947.0,
+ "eval_runtime": 86.5175,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 1880
+ },
+ {
+ "entropy": 0.30791807882487776,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 0.8123113512992859,
+ "learning_rate": 0.00014341760442398248,
+ "loss": 0.2395785331726074,
+ "mean_token_accuracy": 0.918928150832653,
+ "num_tokens": 4433050.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.7272727272727275,
+ "eval_entropy": 0.39762327222283494,
+ "eval_loss": 0.5994202494621277,
+ "eval_mean_token_accuracy": 0.8509274201337681,
+ "eval_num_tokens": 4433050.0,
+ "eval_runtime": 86.2873,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.993,
+ "step": 1900
+ },
+ {
+ "entropy": 0.3021434534341097,
+ "epoch": 4.777085927770859,
+ "grad_norm": 0.731787383556366,
+ "learning_rate": 0.000141519962826766,
+ "loss": 0.23494718074798585,
+ "mean_token_accuracy": 0.9201403826475143,
+ "num_tokens": 4483598.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.777085927770859,
+ "eval_entropy": 0.3827026732439219,
+ "eval_loss": 0.5995895862579346,
+ "eval_mean_token_accuracy": 0.851468373523202,
+ "eval_num_tokens": 4483598.0,
+ "eval_runtime": 86.3006,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 1920
+ },
+ {
+ "entropy": 0.31626159623265265,
+ "epoch": 4.826899128268991,
+ "grad_norm": 0.8848487138748169,
+ "learning_rate": 0.00013961376213795132,
+ "loss": 0.2439030647277832,
+ "mean_token_accuracy": 0.9196575872600079,
+ "num_tokens": 4529201.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.826899128268991,
+ "eval_entropy": 0.388698436839636,
+ "eval_loss": 0.6000174283981323,
+ "eval_mean_token_accuracy": 0.8518068187458571,
+ "eval_num_tokens": 4529201.0,
+ "eval_runtime": 86.8979,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.979,
+ "step": 1940
+ },
+ {
+ "entropy": 0.30520407035946845,
+ "epoch": 4.876712328767123,
+ "grad_norm": 0.8532460927963257,
+ "learning_rate": 0.00013769957724166695,
+ "loss": 0.23458616733551024,
+ "mean_token_accuracy": 0.9221912942826748,
+ "num_tokens": 4578167.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.876712328767123,
+ "eval_entropy": 0.38777847102908203,
+ "eval_loss": 0.6004981398582458,
+ "eval_mean_token_accuracy": 0.8516481768253238,
+ "eval_num_tokens": 4578167.0,
+ "eval_runtime": 87.0777,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.975,
+ "step": 1960
+ },
+ {
+ "entropy": 0.3226448342204094,
+ "epoch": 4.926525529265255,
+ "grad_norm": 0.6945561766624451,
+ "learning_rate": 0.0001357779854299694,
+ "loss": 0.24048397541046143,
+ "mean_token_accuracy": 0.9195300146937371,
+ "num_tokens": 4622316.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.926525529265255,
+ "eval_entropy": 0.38581624263247777,
+ "eval_loss": 0.6029234528541565,
+ "eval_mean_token_accuracy": 0.8514213260523108,
+ "eval_num_tokens": 4622316.0,
+ "eval_runtime": 85.8729,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 1980
+ },
+ {
+ "entropy": 0.3051655298098922,
+ "epoch": 4.976338729763388,
+ "grad_norm": 0.7976452708244324,
+ "learning_rate": 0.00013384956622874001,
+ "loss": 0.23584742546081544,
+ "mean_token_accuracy": 0.9216851457953453,
+ "num_tokens": 4670746.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.976338729763388,
+ "eval_entropy": 0.37913159246361533,
+ "eval_loss": 0.6057604551315308,
+ "eval_mean_token_accuracy": 0.8525801203971686,
+ "eval_num_tokens": 4670746.0,
+ "eval_runtime": 86.1145,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2000
+ },
+ {
+ "entropy": 0.27438195240803254,
+ "epoch": 5.024906600249066,
+ "grad_norm": 0.6729586124420166,
+ "learning_rate": 0.0001319149012229075,
+ "loss": 0.19775952100753785,
+ "mean_token_accuracy": 0.9339428559327737,
+ "num_tokens": 4716176.0,
+ "step": 2020
+ },
+ {
+ "epoch": 5.024906600249066,
+ "eval_entropy": 0.3448961910813354,
+ "eval_loss": 0.6750120520591736,
+ "eval_mean_token_accuracy": 0.8487970232963562,
+ "eval_num_tokens": 4716176.0,
+ "eval_runtime": 86.1169,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2020
+ },
+ {
+ "entropy": 0.21423916313797237,
+ "epoch": 5.074719800747198,
+ "grad_norm": 0.6934391856193542,
+ "learning_rate": 0.00012997457388105022,
+ "loss": 0.1439570426940918,
+ "mean_token_accuracy": 0.9528236843645572,
+ "num_tokens": 4763269.0,
+ "step": 2040
+ },
+ {
+ "epoch": 5.074719800747198,
+ "eval_entropy": 0.3570949243771475,
+ "eval_loss": 0.6465504169464111,
+ "eval_mean_token_accuracy": 0.8490785547467166,
+ "eval_num_tokens": 4763269.0,
+ "eval_runtime": 85.9574,
+ "eval_samples_per_second": 15.996,
+ "eval_steps_per_second": 2.001,
+ "step": 2040
+ },
+ {
+ "entropy": 0.20838565267622472,
+ "epoch": 5.12453300124533,
+ "grad_norm": 0.7286986112594604,
+ "learning_rate": 0.00012802916937942972,
+ "loss": 0.14467307329177856,
+ "mean_token_accuracy": 0.950994835793972,
+ "num_tokens": 4809047.0,
+ "step": 2060
+ },
+ {
+ "epoch": 5.12453300124533,
+ "eval_entropy": 0.3452463157821533,
+ "eval_loss": 0.6705958843231201,
+ "eval_mean_token_accuracy": 0.8490352796953778,
+ "eval_num_tokens": 4809047.0,
+ "eval_runtime": 86.228,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 2060
+ },
+ {
+ "entropy": 0.20453082229942082,
+ "epoch": 5.174346201743462,
+ "grad_norm": 0.7515555620193481,
+ "learning_rate": 0.00012607927442550974,
+ "loss": 0.13732000589370727,
+ "mean_token_accuracy": 0.9537357829511166,
+ "num_tokens": 4857965.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.174346201743462,
+ "eval_entropy": 0.32431264914745506,
+ "eval_loss": 0.6743043065071106,
+ "eval_mean_token_accuracy": 0.8504878629085629,
+ "eval_num_tokens": 4857965.0,
+ "eval_runtime": 86.5948,
+ "eval_samples_per_second": 15.879,
+ "eval_steps_per_second": 1.986,
+ "step": 2080
+ },
+ {
+ "entropy": 0.21812320686876774,
+ "epoch": 5.224159402241594,
+ "grad_norm": 0.9093465209007263,
+ "learning_rate": 0.0001241254770810132,
+ "loss": 0.14311420917510986,
+ "mean_token_accuracy": 0.9514068141579628,
+ "num_tokens": 4905151.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.224159402241594,
+ "eval_entropy": 0.33086285835435225,
+ "eval_loss": 0.6676449179649353,
+ "eval_mean_token_accuracy": 0.8505287662495015,
+ "eval_num_tokens": 4905151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 2100
+ },
+ {
+ "entropy": 0.2180163251236081,
+ "epoch": 5.273972602739726,
+ "grad_norm": 0.6703007221221924,
+ "learning_rate": 0.00012216836658457075,
+ "loss": 0.14803968667984008,
+ "mean_token_accuracy": 0.9521303348243236,
+ "num_tokens": 4947072.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.273972602739726,
+ "eval_entropy": 0.33162341708707255,
+ "eval_loss": 0.6658875942230225,
+ "eval_mean_token_accuracy": 0.8500757605530495,
+ "eval_num_tokens": 4947072.0,
+ "eval_runtime": 86.6296,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 2120
+ },
+ {
+ "entropy": 0.22511130161583423,
+ "epoch": 5.323785803237858,
+ "grad_norm": 0.8078880906105042,
+ "learning_rate": 0.00012020853317401455,
+ "loss": 0.15228408575057983,
+ "mean_token_accuracy": 0.947144789993763,
+ "num_tokens": 4991974.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.323785803237858,
+ "eval_entropy": 0.3354601170434508,
+ "eval_loss": 0.6677829623222351,
+ "eval_mean_token_accuracy": 0.8482600024273229,
+ "eval_num_tokens": 4991974.0,
+ "eval_runtime": 86.4689,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.989,
+ "step": 2140
+ },
+ {
+ "entropy": 0.2244176059961319,
+ "epoch": 5.37359900373599,
+ "grad_norm": 0.9636075496673584,
+ "learning_rate": 0.00011824656790837037,
+ "loss": 0.15260883569717407,
+ "mean_token_accuracy": 0.9471467643976211,
+ "num_tokens": 5038400.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.37359900373599,
+ "eval_entropy": 0.3381616926297199,
+ "eval_loss": 0.6694412231445312,
+ "eval_mean_token_accuracy": 0.8482369603805764,
+ "eval_num_tokens": 5038400.0,
+ "eval_runtime": 86.4147,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 2160
+ },
+ {
+ "entropy": 0.22982364390045404,
+ "epoch": 5.423412204234122,
+ "grad_norm": 0.775401771068573,
+ "learning_rate": 0.00011628306248960262,
+ "loss": 0.15140302181243898,
+ "mean_token_accuracy": 0.9492553934454918,
+ "num_tokens": 5083166.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.423412204234122,
+ "eval_entropy": 0.3305150235808173,
+ "eval_loss": 0.6717822551727295,
+ "eval_mean_token_accuracy": 0.8489849723355715,
+ "eval_num_tokens": 5083166.0,
+ "eval_runtime": 86.4728,
+ "eval_samples_per_second": 15.901,
+ "eval_steps_per_second": 1.989,
+ "step": 2180
+ },
+ {
+ "entropy": 0.21448935717344284,
+ "epoch": 5.473225404732254,
+ "grad_norm": 0.6575281023979187,
+ "learning_rate": 0.00011431860908416465,
+ "loss": 0.1452319622039795,
+ "mean_token_accuracy": 0.9505287684500218,
+ "num_tokens": 5135109.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.473225404732254,
+ "eval_entropy": 0.3488145174328671,
+ "eval_loss": 0.6612305641174316,
+ "eval_mean_token_accuracy": 0.8492907808963642,
+ "eval_num_tokens": 5135109.0,
+ "eval_runtime": 86.6927,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 2200
+ },
+ {
+ "entropy": 0.23091202937066554,
+ "epoch": 5.523038605230386,
+ "grad_norm": 0.8909686207771301,
+ "learning_rate": 0.00011235380014440985,
+ "loss": 0.15150139331817628,
+ "mean_token_accuracy": 0.9497875183820724,
+ "num_tokens": 5180138.0,
+ "step": 2220
+ },
+ {
+ "epoch": 5.523038605230386,
+ "eval_entropy": 0.3268539015810157,
+ "eval_loss": 0.6667542457580566,
+ "eval_mean_token_accuracy": 0.8499062903398691,
+ "eval_num_tokens": 5180138.0,
+ "eval_runtime": 86.4644,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 2220
+ },
+ {
+ "entropy": 0.2227974807843566,
+ "epoch": 5.572851805728518,
+ "grad_norm": 0.6180275082588196,
+ "learning_rate": 0.0001103892282299158,
+ "loss": 0.1491069197654724,
+ "mean_token_accuracy": 0.9488144010305405,
+ "num_tokens": 5226864.0,
+ "step": 2240
+ },
+ {
+ "epoch": 5.572851805728518,
+ "eval_entropy": 0.3346347655494546,
+ "eval_loss": 0.6665948629379272,
+ "eval_mean_token_accuracy": 0.8499961893918903,
+ "eval_num_tokens": 5226864.0,
+ "eval_runtime": 87.0548,
+ "eval_samples_per_second": 15.795,
+ "eval_steps_per_second": 1.976,
+ "step": 2240
+ },
+ {
+ "entropy": 0.21368421968072654,
+ "epoch": 5.62266500622665,
+ "grad_norm": 0.6004369258880615,
+ "learning_rate": 0.00010842548582877651,
+ "loss": 0.14485255479812623,
+ "mean_token_accuracy": 0.9502056457102299,
+ "num_tokens": 5276602.0,
+ "step": 2260
+ },
+ {
+ "epoch": 5.62266500622665,
+ "eval_entropy": 0.32753298804163933,
+ "eval_loss": 0.6680151224136353,
+ "eval_mean_token_accuracy": 0.8515451086121936,
+ "eval_num_tokens": 5276602.0,
+ "eval_runtime": 86.8524,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.98,
+ "step": 2260
+ },
+ {
+ "entropy": 0.2103635374456644,
+ "epoch": 5.672478206724782,
+ "grad_norm": 0.699174702167511,
+ "learning_rate": 0.00010646316517891613,
+ "loss": 0.14297772645950318,
+ "mean_token_accuracy": 0.9512537539005279,
+ "num_tokens": 5323718.0,
+ "step": 2280
+ },
+ {
+ "epoch": 5.672478206724782,
+ "eval_entropy": 0.32966585959806,
+ "eval_loss": 0.675578773021698,
+ "eval_mean_token_accuracy": 0.8509623023659684,
+ "eval_num_tokens": 5323718.0,
+ "eval_runtime": 86.4518,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2280
+ },
+ {
+ "entropy": 0.22516900151968003,
+ "epoch": 5.722291407222914,
+ "grad_norm": 0.6637354493141174,
+ "learning_rate": 0.00010450285808947797,
+ "loss": 0.15202572345733642,
+ "mean_token_accuracy": 0.9482452072203159,
+ "num_tokens": 5369039.0,
+ "step": 2300
+ },
+ {
+ "epoch": 5.722291407222914,
+ "eval_entropy": 0.3369456917740578,
+ "eval_loss": 0.6697061061859131,
+ "eval_mean_token_accuracy": 0.848603522361711,
+ "eval_num_tokens": 5369039.0,
+ "eval_runtime": 86.6371,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.985,
+ "step": 2300
+ },
+ {
+ "entropy": 0.21841065725311637,
+ "epoch": 5.772104607721046,
+ "grad_norm": 0.7940268516540527,
+ "learning_rate": 0.00010254515576234297,
+ "loss": 0.14710167646408082,
+ "mean_token_accuracy": 0.9493498183786869,
+ "num_tokens": 5417029.0,
+ "step": 2320
+ },
+ {
+ "epoch": 5.772104607721046,
+ "eval_entropy": 0.3237486180177955,
+ "eval_loss": 0.6779657602310181,
+ "eval_mean_token_accuracy": 0.8500715313955794,
+ "eval_num_tokens": 5417029.0,
+ "eval_runtime": 86.1826,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 1.996,
+ "step": 2320
+ },
+ {
+ "entropy": 0.22146204356104135,
+ "epoch": 5.821917808219178,
+ "grad_norm": 0.9234833121299744,
+ "learning_rate": 0.00010059064861383132,
+ "loss": 0.14720046520233154,
+ "mean_token_accuracy": 0.9493872679769992,
+ "num_tokens": 5461671.0,
+ "step": 2340
+ },
+ {
+ "epoch": 5.821917808219178,
+ "eval_entropy": 0.32365207564692167,
+ "eval_loss": 0.6704005002975464,
+ "eval_mean_token_accuracy": 0.8507985760306203,
+ "eval_num_tokens": 5461671.0,
+ "eval_runtime": 86.5494,
+ "eval_samples_per_second": 15.887,
+ "eval_steps_per_second": 1.987,
+ "step": 2340
+ },
+ {
+ "entropy": 0.20934011954814197,
+ "epoch": 5.87173100871731,
+ "grad_norm": 0.5547503232955933,
+ "learning_rate": 9.863992609664084e-05,
+ "loss": 0.1464867353439331,
+ "mean_token_accuracy": 0.9503875687718392,
+ "num_tokens": 5509312.0,
+ "step": 2360
+ },
+ {
+ "epoch": 5.87173100871731,
+ "eval_entropy": 0.3330401429083458,
+ "eval_loss": 0.6659091114997864,
+ "eval_mean_token_accuracy": 0.8504848906467127,
+ "eval_num_tokens": 5509312.0,
+ "eval_runtime": 86.5855,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 2360
+ },
+ {
+ "entropy": 0.21678635366261007,
+ "epoch": 5.921544209215442,
+ "grad_norm": 0.570612907409668,
+ "learning_rate": 9.669357652207635e-05,
+ "loss": 0.14821385145187377,
+ "mean_token_accuracy": 0.9503940217196941,
+ "num_tokens": 5558196.0,
+ "step": 2380
+ },
+ {
+ "epoch": 5.921544209215442,
+ "eval_entropy": 0.3322022325077722,
+ "eval_loss": 0.6722489595413208,
+ "eval_mean_token_accuracy": 0.8489979422369669,
+ "eval_num_tokens": 5558196.0,
+ "eval_runtime": 86.2986,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 2380
+ },
+ {
+ "entropy": 0.20932920072227718,
+ "epoch": 5.971357409713574,
+ "grad_norm": 0.7879557609558105,
+ "learning_rate": 9.475218688262262e-05,
+ "loss": 0.14675841331481934,
+ "mean_token_accuracy": 0.9507176131010056,
+ "num_tokens": 5605400.0,
+ "step": 2400
+ },
+ {
+ "epoch": 5.971357409713574,
+ "eval_entropy": 0.3199348642902319,
+ "eval_loss": 0.6698136329650879,
+ "eval_mean_token_accuracy": 0.8514142130003419,
+ "eval_num_tokens": 5605400.0,
+ "eval_runtime": 85.8995,
+ "eval_samples_per_second": 16.007,
+ "eval_steps_per_second": 2.002,
+ "step": 2400
+ },
+ {
+ "entropy": 0.21032143919131693,
+ "epoch": 6.019925280199253,
+ "grad_norm": 0.5823076367378235,
+ "learning_rate": 9.281634267491569e-05,
+ "loss": 0.13322267532348633,
+ "mean_token_accuracy": 0.9550939072401096,
+ "num_tokens": 5648968.0,
+ "step": 2420
+ },
+ {
+ "epoch": 6.019925280199253,
+ "eval_entropy": 0.30206270117399303,
+ "eval_loss": 0.7093168497085571,
+ "eval_mean_token_accuracy": 0.8500627639681794,
+ "eval_num_tokens": 5648968.0,
+ "eval_runtime": 85.8128,
+ "eval_samples_per_second": 16.023,
+ "eval_steps_per_second": 2.004,
+ "step": 2420
+ },
+ {
+ "entropy": 0.1534628233872354,
+ "epoch": 6.069738480697385,
+ "grad_norm": 0.710133969783783,
+ "learning_rate": 9.088662772316508e-05,
+ "loss": 0.09078952670097351,
+ "mean_token_accuracy": 0.9678447999060154,
+ "num_tokens": 5697633.0,
+ "step": 2440
+ },
+ {
+ "epoch": 6.069738480697385,
+ "eval_entropy": 0.28208133101809857,
+ "eval_loss": 0.7636417150497437,
+ "eval_mean_token_accuracy": 0.8494061477655588,
+ "eval_num_tokens": 5697633.0,
+ "eval_runtime": 85.9724,
+ "eval_samples_per_second": 15.994,
+ "eval_steps_per_second": 2.001,
+ "step": 2440
+ },
+ {
+ "entropy": 0.16151462448760867,
+ "epoch": 6.119551681195516,
+ "grad_norm": 0.5793812274932861,
+ "learning_rate": 8.896362400308028e-05,
+ "loss": 0.09545697569847107,
+ "mean_token_accuracy": 0.9671573750674725,
+ "num_tokens": 5745090.0,
+ "step": 2460
+ },
+ {
+ "epoch": 6.119551681195516,
+ "eval_entropy": 0.2833245605403601,
+ "eval_loss": 0.7402405738830566,
+ "eval_mean_token_accuracy": 0.8503523728875226,
+ "eval_num_tokens": 5745090.0,
+ "eval_runtime": 85.5461,
+ "eval_samples_per_second": 16.073,
+ "eval_steps_per_second": 2.011,
+ "step": 2460
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.4259789336409088e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2480/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2480/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2480/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2480/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2480/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2480/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2480/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2480/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2480/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2480/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2480/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2480/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2480/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2480/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..cbf4e4e237b22dbed504117174bedc03df225b3c
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2480/trainer_state.json
@@ -0,0 +1,2638 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 6.169364881693649,
+ "eval_steps": 20,
+ "global_step": 2480,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ },
+ {
+ "entropy": 0.3193941755220294,
+ "epoch": 4.5280199252802,
+ "grad_norm": 0.8281906843185425,
+ "learning_rate": 0.0001509111761786888,
+ "loss": 0.23936262130737304,
+ "mean_token_accuracy": 0.9201708927750587,
+ "num_tokens": 4244423.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.5280199252802,
+ "eval_entropy": 0.38704028864239537,
+ "eval_loss": 0.6006569266319275,
+ "eval_mean_token_accuracy": 0.8502406720505205,
+ "eval_num_tokens": 4244423.0,
+ "eval_runtime": 86.8059,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1820
+ },
+ {
+ "entropy": 0.3164879363030195,
+ "epoch": 4.577833125778331,
+ "grad_norm": 0.7892968654632568,
+ "learning_rate": 0.00014905346557909867,
+ "loss": 0.24541733264923096,
+ "mean_token_accuracy": 0.9175932116806507,
+ "num_tokens": 4289773.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.577833125778331,
+ "eval_entropy": 0.38861122120951497,
+ "eval_loss": 0.6115967631340027,
+ "eval_mean_token_accuracy": 0.849471275196519,
+ "eval_num_tokens": 4289773.0,
+ "eval_runtime": 86.2946,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1840
+ },
+ {
+ "entropy": 0.3051785985007882,
+ "epoch": 4.627646326276463,
+ "grad_norm": 0.8109654188156128,
+ "learning_rate": 0.0001471849238862319,
+ "loss": 0.23433220386505127,
+ "mean_token_accuracy": 0.9206570319831371,
+ "num_tokens": 4336894.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.627646326276463,
+ "eval_entropy": 0.37162452295076015,
+ "eval_loss": 0.6184061765670776,
+ "eval_mean_token_accuracy": 0.8501173268223918,
+ "eval_num_tokens": 4336894.0,
+ "eval_runtime": 86.6865,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1860
+ },
+ {
+ "entropy": 0.3168198253959417,
+ "epoch": 4.677459526774595,
+ "grad_norm": 0.9512342214584351,
+ "learning_rate": 0.0001453061146267775,
+ "loss": 0.23832404613494873,
+ "mean_token_accuracy": 0.9197044663131237,
+ "num_tokens": 4382947.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.677459526774595,
+ "eval_entropy": 0.3845940856912801,
+ "eval_loss": 0.606762707233429,
+ "eval_mean_token_accuracy": 0.8504838194957999,
+ "eval_num_tokens": 4382947.0,
+ "eval_runtime": 86.5175,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 1880
+ },
+ {
+ "entropy": 0.30791807882487776,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 0.8123113512992859,
+ "learning_rate": 0.00014341760442398248,
+ "loss": 0.2395785331726074,
+ "mean_token_accuracy": 0.918928150832653,
+ "num_tokens": 4433050.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.7272727272727275,
+ "eval_entropy": 0.39762327222283494,
+ "eval_loss": 0.5994202494621277,
+ "eval_mean_token_accuracy": 0.8509274201337681,
+ "eval_num_tokens": 4433050.0,
+ "eval_runtime": 86.2873,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.993,
+ "step": 1900
+ },
+ {
+ "entropy": 0.3021434534341097,
+ "epoch": 4.777085927770859,
+ "grad_norm": 0.731787383556366,
+ "learning_rate": 0.000141519962826766,
+ "loss": 0.23494718074798585,
+ "mean_token_accuracy": 0.9201403826475143,
+ "num_tokens": 4483598.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.777085927770859,
+ "eval_entropy": 0.3827026732439219,
+ "eval_loss": 0.5995895862579346,
+ "eval_mean_token_accuracy": 0.851468373523202,
+ "eval_num_tokens": 4483598.0,
+ "eval_runtime": 86.3006,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 1920
+ },
+ {
+ "entropy": 0.31626159623265265,
+ "epoch": 4.826899128268991,
+ "grad_norm": 0.8848487138748169,
+ "learning_rate": 0.00013961376213795132,
+ "loss": 0.2439030647277832,
+ "mean_token_accuracy": 0.9196575872600079,
+ "num_tokens": 4529201.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.826899128268991,
+ "eval_entropy": 0.388698436839636,
+ "eval_loss": 0.6000174283981323,
+ "eval_mean_token_accuracy": 0.8518068187458571,
+ "eval_num_tokens": 4529201.0,
+ "eval_runtime": 86.8979,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.979,
+ "step": 1940
+ },
+ {
+ "entropy": 0.30520407035946845,
+ "epoch": 4.876712328767123,
+ "grad_norm": 0.8532460927963257,
+ "learning_rate": 0.00013769957724166695,
+ "loss": 0.23458616733551024,
+ "mean_token_accuracy": 0.9221912942826748,
+ "num_tokens": 4578167.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.876712328767123,
+ "eval_entropy": 0.38777847102908203,
+ "eval_loss": 0.6004981398582458,
+ "eval_mean_token_accuracy": 0.8516481768253238,
+ "eval_num_tokens": 4578167.0,
+ "eval_runtime": 87.0777,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.975,
+ "step": 1960
+ },
+ {
+ "entropy": 0.3226448342204094,
+ "epoch": 4.926525529265255,
+ "grad_norm": 0.6945561766624451,
+ "learning_rate": 0.0001357779854299694,
+ "loss": 0.24048397541046143,
+ "mean_token_accuracy": 0.9195300146937371,
+ "num_tokens": 4622316.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.926525529265255,
+ "eval_entropy": 0.38581624263247777,
+ "eval_loss": 0.6029234528541565,
+ "eval_mean_token_accuracy": 0.8514213260523108,
+ "eval_num_tokens": 4622316.0,
+ "eval_runtime": 85.8729,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 1980
+ },
+ {
+ "entropy": 0.3051655298098922,
+ "epoch": 4.976338729763388,
+ "grad_norm": 0.7976452708244324,
+ "learning_rate": 0.00013384956622874001,
+ "loss": 0.23584742546081544,
+ "mean_token_accuracy": 0.9216851457953453,
+ "num_tokens": 4670746.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.976338729763388,
+ "eval_entropy": 0.37913159246361533,
+ "eval_loss": 0.6057604551315308,
+ "eval_mean_token_accuracy": 0.8525801203971686,
+ "eval_num_tokens": 4670746.0,
+ "eval_runtime": 86.1145,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2000
+ },
+ {
+ "entropy": 0.27438195240803254,
+ "epoch": 5.024906600249066,
+ "grad_norm": 0.6729586124420166,
+ "learning_rate": 0.0001319149012229075,
+ "loss": 0.19775952100753785,
+ "mean_token_accuracy": 0.9339428559327737,
+ "num_tokens": 4716176.0,
+ "step": 2020
+ },
+ {
+ "epoch": 5.024906600249066,
+ "eval_entropy": 0.3448961910813354,
+ "eval_loss": 0.6750120520591736,
+ "eval_mean_token_accuracy": 0.8487970232963562,
+ "eval_num_tokens": 4716176.0,
+ "eval_runtime": 86.1169,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2020
+ },
+ {
+ "entropy": 0.21423916313797237,
+ "epoch": 5.074719800747198,
+ "grad_norm": 0.6934391856193542,
+ "learning_rate": 0.00012997457388105022,
+ "loss": 0.1439570426940918,
+ "mean_token_accuracy": 0.9528236843645572,
+ "num_tokens": 4763269.0,
+ "step": 2040
+ },
+ {
+ "epoch": 5.074719800747198,
+ "eval_entropy": 0.3570949243771475,
+ "eval_loss": 0.6465504169464111,
+ "eval_mean_token_accuracy": 0.8490785547467166,
+ "eval_num_tokens": 4763269.0,
+ "eval_runtime": 85.9574,
+ "eval_samples_per_second": 15.996,
+ "eval_steps_per_second": 2.001,
+ "step": 2040
+ },
+ {
+ "entropy": 0.20838565267622472,
+ "epoch": 5.12453300124533,
+ "grad_norm": 0.7286986112594604,
+ "learning_rate": 0.00012802916937942972,
+ "loss": 0.14467307329177856,
+ "mean_token_accuracy": 0.950994835793972,
+ "num_tokens": 4809047.0,
+ "step": 2060
+ },
+ {
+ "epoch": 5.12453300124533,
+ "eval_entropy": 0.3452463157821533,
+ "eval_loss": 0.6705958843231201,
+ "eval_mean_token_accuracy": 0.8490352796953778,
+ "eval_num_tokens": 4809047.0,
+ "eval_runtime": 86.228,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 2060
+ },
+ {
+ "entropy": 0.20453082229942082,
+ "epoch": 5.174346201743462,
+ "grad_norm": 0.7515555620193481,
+ "learning_rate": 0.00012607927442550974,
+ "loss": 0.13732000589370727,
+ "mean_token_accuracy": 0.9537357829511166,
+ "num_tokens": 4857965.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.174346201743462,
+ "eval_entropy": 0.32431264914745506,
+ "eval_loss": 0.6743043065071106,
+ "eval_mean_token_accuracy": 0.8504878629085629,
+ "eval_num_tokens": 4857965.0,
+ "eval_runtime": 86.5948,
+ "eval_samples_per_second": 15.879,
+ "eval_steps_per_second": 1.986,
+ "step": 2080
+ },
+ {
+ "entropy": 0.21812320686876774,
+ "epoch": 5.224159402241594,
+ "grad_norm": 0.9093465209007263,
+ "learning_rate": 0.0001241254770810132,
+ "loss": 0.14311420917510986,
+ "mean_token_accuracy": 0.9514068141579628,
+ "num_tokens": 4905151.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.224159402241594,
+ "eval_entropy": 0.33086285835435225,
+ "eval_loss": 0.6676449179649353,
+ "eval_mean_token_accuracy": 0.8505287662495015,
+ "eval_num_tokens": 4905151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 2100
+ },
+ {
+ "entropy": 0.2180163251236081,
+ "epoch": 5.273972602739726,
+ "grad_norm": 0.6703007221221924,
+ "learning_rate": 0.00012216836658457075,
+ "loss": 0.14803968667984008,
+ "mean_token_accuracy": 0.9521303348243236,
+ "num_tokens": 4947072.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.273972602739726,
+ "eval_entropy": 0.33162341708707255,
+ "eval_loss": 0.6658875942230225,
+ "eval_mean_token_accuracy": 0.8500757605530495,
+ "eval_num_tokens": 4947072.0,
+ "eval_runtime": 86.6296,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 2120
+ },
+ {
+ "entropy": 0.22511130161583423,
+ "epoch": 5.323785803237858,
+ "grad_norm": 0.8078880906105042,
+ "learning_rate": 0.00012020853317401455,
+ "loss": 0.15228408575057983,
+ "mean_token_accuracy": 0.947144789993763,
+ "num_tokens": 4991974.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.323785803237858,
+ "eval_entropy": 0.3354601170434508,
+ "eval_loss": 0.6677829623222351,
+ "eval_mean_token_accuracy": 0.8482600024273229,
+ "eval_num_tokens": 4991974.0,
+ "eval_runtime": 86.4689,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.989,
+ "step": 2140
+ },
+ {
+ "entropy": 0.2244176059961319,
+ "epoch": 5.37359900373599,
+ "grad_norm": 0.9636075496673584,
+ "learning_rate": 0.00011824656790837037,
+ "loss": 0.15260883569717407,
+ "mean_token_accuracy": 0.9471467643976211,
+ "num_tokens": 5038400.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.37359900373599,
+ "eval_entropy": 0.3381616926297199,
+ "eval_loss": 0.6694412231445312,
+ "eval_mean_token_accuracy": 0.8482369603805764,
+ "eval_num_tokens": 5038400.0,
+ "eval_runtime": 86.4147,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 2160
+ },
+ {
+ "entropy": 0.22982364390045404,
+ "epoch": 5.423412204234122,
+ "grad_norm": 0.775401771068573,
+ "learning_rate": 0.00011628306248960262,
+ "loss": 0.15140302181243898,
+ "mean_token_accuracy": 0.9492553934454918,
+ "num_tokens": 5083166.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.423412204234122,
+ "eval_entropy": 0.3305150235808173,
+ "eval_loss": 0.6717822551727295,
+ "eval_mean_token_accuracy": 0.8489849723355715,
+ "eval_num_tokens": 5083166.0,
+ "eval_runtime": 86.4728,
+ "eval_samples_per_second": 15.901,
+ "eval_steps_per_second": 1.989,
+ "step": 2180
+ },
+ {
+ "entropy": 0.21448935717344284,
+ "epoch": 5.473225404732254,
+ "grad_norm": 0.6575281023979187,
+ "learning_rate": 0.00011431860908416465,
+ "loss": 0.1452319622039795,
+ "mean_token_accuracy": 0.9505287684500218,
+ "num_tokens": 5135109.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.473225404732254,
+ "eval_entropy": 0.3488145174328671,
+ "eval_loss": 0.6612305641174316,
+ "eval_mean_token_accuracy": 0.8492907808963642,
+ "eval_num_tokens": 5135109.0,
+ "eval_runtime": 86.6927,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 2200
+ },
+ {
+ "entropy": 0.23091202937066554,
+ "epoch": 5.523038605230386,
+ "grad_norm": 0.8909686207771301,
+ "learning_rate": 0.00011235380014440985,
+ "loss": 0.15150139331817628,
+ "mean_token_accuracy": 0.9497875183820724,
+ "num_tokens": 5180138.0,
+ "step": 2220
+ },
+ {
+ "epoch": 5.523038605230386,
+ "eval_entropy": 0.3268539015810157,
+ "eval_loss": 0.6667542457580566,
+ "eval_mean_token_accuracy": 0.8499062903398691,
+ "eval_num_tokens": 5180138.0,
+ "eval_runtime": 86.4644,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 2220
+ },
+ {
+ "entropy": 0.2227974807843566,
+ "epoch": 5.572851805728518,
+ "grad_norm": 0.6180275082588196,
+ "learning_rate": 0.0001103892282299158,
+ "loss": 0.1491069197654724,
+ "mean_token_accuracy": 0.9488144010305405,
+ "num_tokens": 5226864.0,
+ "step": 2240
+ },
+ {
+ "epoch": 5.572851805728518,
+ "eval_entropy": 0.3346347655494546,
+ "eval_loss": 0.6665948629379272,
+ "eval_mean_token_accuracy": 0.8499961893918903,
+ "eval_num_tokens": 5226864.0,
+ "eval_runtime": 87.0548,
+ "eval_samples_per_second": 15.795,
+ "eval_steps_per_second": 1.976,
+ "step": 2240
+ },
+ {
+ "entropy": 0.21368421968072654,
+ "epoch": 5.62266500622665,
+ "grad_norm": 0.6004369258880615,
+ "learning_rate": 0.00010842548582877651,
+ "loss": 0.14485255479812623,
+ "mean_token_accuracy": 0.9502056457102299,
+ "num_tokens": 5276602.0,
+ "step": 2260
+ },
+ {
+ "epoch": 5.62266500622665,
+ "eval_entropy": 0.32753298804163933,
+ "eval_loss": 0.6680151224136353,
+ "eval_mean_token_accuracy": 0.8515451086121936,
+ "eval_num_tokens": 5276602.0,
+ "eval_runtime": 86.8524,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.98,
+ "step": 2260
+ },
+ {
+ "entropy": 0.2103635374456644,
+ "epoch": 5.672478206724782,
+ "grad_norm": 0.699174702167511,
+ "learning_rate": 0.00010646316517891613,
+ "loss": 0.14297772645950318,
+ "mean_token_accuracy": 0.9512537539005279,
+ "num_tokens": 5323718.0,
+ "step": 2280
+ },
+ {
+ "epoch": 5.672478206724782,
+ "eval_entropy": 0.32966585959806,
+ "eval_loss": 0.675578773021698,
+ "eval_mean_token_accuracy": 0.8509623023659684,
+ "eval_num_tokens": 5323718.0,
+ "eval_runtime": 86.4518,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2280
+ },
+ {
+ "entropy": 0.22516900151968003,
+ "epoch": 5.722291407222914,
+ "grad_norm": 0.6637354493141174,
+ "learning_rate": 0.00010450285808947797,
+ "loss": 0.15202572345733642,
+ "mean_token_accuracy": 0.9482452072203159,
+ "num_tokens": 5369039.0,
+ "step": 2300
+ },
+ {
+ "epoch": 5.722291407222914,
+ "eval_entropy": 0.3369456917740578,
+ "eval_loss": 0.6697061061859131,
+ "eval_mean_token_accuracy": 0.848603522361711,
+ "eval_num_tokens": 5369039.0,
+ "eval_runtime": 86.6371,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.985,
+ "step": 2300
+ },
+ {
+ "entropy": 0.21841065725311637,
+ "epoch": 5.772104607721046,
+ "grad_norm": 0.7940268516540527,
+ "learning_rate": 0.00010254515576234297,
+ "loss": 0.14710167646408082,
+ "mean_token_accuracy": 0.9493498183786869,
+ "num_tokens": 5417029.0,
+ "step": 2320
+ },
+ {
+ "epoch": 5.772104607721046,
+ "eval_entropy": 0.3237486180177955,
+ "eval_loss": 0.6779657602310181,
+ "eval_mean_token_accuracy": 0.8500715313955794,
+ "eval_num_tokens": 5417029.0,
+ "eval_runtime": 86.1826,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 1.996,
+ "step": 2320
+ },
+ {
+ "entropy": 0.22146204356104135,
+ "epoch": 5.821917808219178,
+ "grad_norm": 0.9234833121299744,
+ "learning_rate": 0.00010059064861383132,
+ "loss": 0.14720046520233154,
+ "mean_token_accuracy": 0.9493872679769992,
+ "num_tokens": 5461671.0,
+ "step": 2340
+ },
+ {
+ "epoch": 5.821917808219178,
+ "eval_entropy": 0.32365207564692167,
+ "eval_loss": 0.6704005002975464,
+ "eval_mean_token_accuracy": 0.8507985760306203,
+ "eval_num_tokens": 5461671.0,
+ "eval_runtime": 86.5494,
+ "eval_samples_per_second": 15.887,
+ "eval_steps_per_second": 1.987,
+ "step": 2340
+ },
+ {
+ "entropy": 0.20934011954814197,
+ "epoch": 5.87173100871731,
+ "grad_norm": 0.5547503232955933,
+ "learning_rate": 9.863992609664084e-05,
+ "loss": 0.1464867353439331,
+ "mean_token_accuracy": 0.9503875687718392,
+ "num_tokens": 5509312.0,
+ "step": 2360
+ },
+ {
+ "epoch": 5.87173100871731,
+ "eval_entropy": 0.3330401429083458,
+ "eval_loss": 0.6659091114997864,
+ "eval_mean_token_accuracy": 0.8504848906467127,
+ "eval_num_tokens": 5509312.0,
+ "eval_runtime": 86.5855,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 2360
+ },
+ {
+ "entropy": 0.21678635366261007,
+ "epoch": 5.921544209215442,
+ "grad_norm": 0.570612907409668,
+ "learning_rate": 9.669357652207635e-05,
+ "loss": 0.14821385145187377,
+ "mean_token_accuracy": 0.9503940217196941,
+ "num_tokens": 5558196.0,
+ "step": 2380
+ },
+ {
+ "epoch": 5.921544209215442,
+ "eval_entropy": 0.3322022325077722,
+ "eval_loss": 0.6722489595413208,
+ "eval_mean_token_accuracy": 0.8489979422369669,
+ "eval_num_tokens": 5558196.0,
+ "eval_runtime": 86.2986,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 2380
+ },
+ {
+ "entropy": 0.20932920072227718,
+ "epoch": 5.971357409713574,
+ "grad_norm": 0.7879557609558105,
+ "learning_rate": 9.475218688262262e-05,
+ "loss": 0.14675841331481934,
+ "mean_token_accuracy": 0.9507176131010056,
+ "num_tokens": 5605400.0,
+ "step": 2400
+ },
+ {
+ "epoch": 5.971357409713574,
+ "eval_entropy": 0.3199348642902319,
+ "eval_loss": 0.6698136329650879,
+ "eval_mean_token_accuracy": 0.8514142130003419,
+ "eval_num_tokens": 5605400.0,
+ "eval_runtime": 85.8995,
+ "eval_samples_per_second": 16.007,
+ "eval_steps_per_second": 2.002,
+ "step": 2400
+ },
+ {
+ "entropy": 0.21032143919131693,
+ "epoch": 6.019925280199253,
+ "grad_norm": 0.5823076367378235,
+ "learning_rate": 9.281634267491569e-05,
+ "loss": 0.13322267532348633,
+ "mean_token_accuracy": 0.9550939072401096,
+ "num_tokens": 5648968.0,
+ "step": 2420
+ },
+ {
+ "epoch": 6.019925280199253,
+ "eval_entropy": 0.30206270117399303,
+ "eval_loss": 0.7093168497085571,
+ "eval_mean_token_accuracy": 0.8500627639681794,
+ "eval_num_tokens": 5648968.0,
+ "eval_runtime": 85.8128,
+ "eval_samples_per_second": 16.023,
+ "eval_steps_per_second": 2.004,
+ "step": 2420
+ },
+ {
+ "entropy": 0.1534628233872354,
+ "epoch": 6.069738480697385,
+ "grad_norm": 0.710133969783783,
+ "learning_rate": 9.088662772316508e-05,
+ "loss": 0.09078952670097351,
+ "mean_token_accuracy": 0.9678447999060154,
+ "num_tokens": 5697633.0,
+ "step": 2440
+ },
+ {
+ "epoch": 6.069738480697385,
+ "eval_entropy": 0.28208133101809857,
+ "eval_loss": 0.7636417150497437,
+ "eval_mean_token_accuracy": 0.8494061477655588,
+ "eval_num_tokens": 5697633.0,
+ "eval_runtime": 85.9724,
+ "eval_samples_per_second": 15.994,
+ "eval_steps_per_second": 2.001,
+ "step": 2440
+ },
+ {
+ "entropy": 0.16151462448760867,
+ "epoch": 6.119551681195516,
+ "grad_norm": 0.5793812274932861,
+ "learning_rate": 8.896362400308028e-05,
+ "loss": 0.09545697569847107,
+ "mean_token_accuracy": 0.9671573750674725,
+ "num_tokens": 5745090.0,
+ "step": 2460
+ },
+ {
+ "epoch": 6.119551681195516,
+ "eval_entropy": 0.2833245605403601,
+ "eval_loss": 0.7402405738830566,
+ "eval_mean_token_accuracy": 0.8503523728875226,
+ "eval_num_tokens": 5745090.0,
+ "eval_runtime": 85.5461,
+ "eval_samples_per_second": 16.073,
+ "eval_steps_per_second": 2.011,
+ "step": 2460
+ },
+ {
+ "entropy": 0.15203177919611335,
+ "epoch": 6.169364881693649,
+ "grad_norm": 0.4251123368740082,
+ "learning_rate": 8.704791146635483e-05,
+ "loss": 0.09420782327651978,
+ "mean_token_accuracy": 0.9677386932075024,
+ "num_tokens": 5790333.0,
+ "step": 2480
+ },
+ {
+ "epoch": 6.169364881693649,
+ "eval_entropy": 0.28572545962971313,
+ "eval_loss": 0.735416829586029,
+ "eval_mean_token_accuracy": 0.8487084663884584,
+ "eval_num_tokens": 5790333.0,
+ "eval_runtime": 85.4801,
+ "eval_samples_per_second": 16.086,
+ "eval_steps_per_second": 2.012,
+ "step": 2480
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.4449421303417446e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2500/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2500/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2500/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2500/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2500/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2500/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2500/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2500/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2500/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2500/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2500/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2500/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2500/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2500/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..aec76cd7cc58b0dd7f6d37aa5ff29572a08e1f35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2500/trainer_state.json
@@ -0,0 +1,2659 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 6.219178082191781,
+ "eval_steps": 20,
+ "global_step": 2500,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ },
+ {
+ "entropy": 0.3193941755220294,
+ "epoch": 4.5280199252802,
+ "grad_norm": 0.8281906843185425,
+ "learning_rate": 0.0001509111761786888,
+ "loss": 0.23936262130737304,
+ "mean_token_accuracy": 0.9201708927750587,
+ "num_tokens": 4244423.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.5280199252802,
+ "eval_entropy": 0.38704028864239537,
+ "eval_loss": 0.6006569266319275,
+ "eval_mean_token_accuracy": 0.8502406720505205,
+ "eval_num_tokens": 4244423.0,
+ "eval_runtime": 86.8059,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1820
+ },
+ {
+ "entropy": 0.3164879363030195,
+ "epoch": 4.577833125778331,
+ "grad_norm": 0.7892968654632568,
+ "learning_rate": 0.00014905346557909867,
+ "loss": 0.24541733264923096,
+ "mean_token_accuracy": 0.9175932116806507,
+ "num_tokens": 4289773.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.577833125778331,
+ "eval_entropy": 0.38861122120951497,
+ "eval_loss": 0.6115967631340027,
+ "eval_mean_token_accuracy": 0.849471275196519,
+ "eval_num_tokens": 4289773.0,
+ "eval_runtime": 86.2946,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1840
+ },
+ {
+ "entropy": 0.3051785985007882,
+ "epoch": 4.627646326276463,
+ "grad_norm": 0.8109654188156128,
+ "learning_rate": 0.0001471849238862319,
+ "loss": 0.23433220386505127,
+ "mean_token_accuracy": 0.9206570319831371,
+ "num_tokens": 4336894.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.627646326276463,
+ "eval_entropy": 0.37162452295076015,
+ "eval_loss": 0.6184061765670776,
+ "eval_mean_token_accuracy": 0.8501173268223918,
+ "eval_num_tokens": 4336894.0,
+ "eval_runtime": 86.6865,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1860
+ },
+ {
+ "entropy": 0.3168198253959417,
+ "epoch": 4.677459526774595,
+ "grad_norm": 0.9512342214584351,
+ "learning_rate": 0.0001453061146267775,
+ "loss": 0.23832404613494873,
+ "mean_token_accuracy": 0.9197044663131237,
+ "num_tokens": 4382947.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.677459526774595,
+ "eval_entropy": 0.3845940856912801,
+ "eval_loss": 0.606762707233429,
+ "eval_mean_token_accuracy": 0.8504838194957999,
+ "eval_num_tokens": 4382947.0,
+ "eval_runtime": 86.5175,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 1880
+ },
+ {
+ "entropy": 0.30791807882487776,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 0.8123113512992859,
+ "learning_rate": 0.00014341760442398248,
+ "loss": 0.2395785331726074,
+ "mean_token_accuracy": 0.918928150832653,
+ "num_tokens": 4433050.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.7272727272727275,
+ "eval_entropy": 0.39762327222283494,
+ "eval_loss": 0.5994202494621277,
+ "eval_mean_token_accuracy": 0.8509274201337681,
+ "eval_num_tokens": 4433050.0,
+ "eval_runtime": 86.2873,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.993,
+ "step": 1900
+ },
+ {
+ "entropy": 0.3021434534341097,
+ "epoch": 4.777085927770859,
+ "grad_norm": 0.731787383556366,
+ "learning_rate": 0.000141519962826766,
+ "loss": 0.23494718074798585,
+ "mean_token_accuracy": 0.9201403826475143,
+ "num_tokens": 4483598.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.777085927770859,
+ "eval_entropy": 0.3827026732439219,
+ "eval_loss": 0.5995895862579346,
+ "eval_mean_token_accuracy": 0.851468373523202,
+ "eval_num_tokens": 4483598.0,
+ "eval_runtime": 86.3006,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 1920
+ },
+ {
+ "entropy": 0.31626159623265265,
+ "epoch": 4.826899128268991,
+ "grad_norm": 0.8848487138748169,
+ "learning_rate": 0.00013961376213795132,
+ "loss": 0.2439030647277832,
+ "mean_token_accuracy": 0.9196575872600079,
+ "num_tokens": 4529201.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.826899128268991,
+ "eval_entropy": 0.388698436839636,
+ "eval_loss": 0.6000174283981323,
+ "eval_mean_token_accuracy": 0.8518068187458571,
+ "eval_num_tokens": 4529201.0,
+ "eval_runtime": 86.8979,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.979,
+ "step": 1940
+ },
+ {
+ "entropy": 0.30520407035946845,
+ "epoch": 4.876712328767123,
+ "grad_norm": 0.8532460927963257,
+ "learning_rate": 0.00013769957724166695,
+ "loss": 0.23458616733551024,
+ "mean_token_accuracy": 0.9221912942826748,
+ "num_tokens": 4578167.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.876712328767123,
+ "eval_entropy": 0.38777847102908203,
+ "eval_loss": 0.6004981398582458,
+ "eval_mean_token_accuracy": 0.8516481768253238,
+ "eval_num_tokens": 4578167.0,
+ "eval_runtime": 87.0777,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.975,
+ "step": 1960
+ },
+ {
+ "entropy": 0.3226448342204094,
+ "epoch": 4.926525529265255,
+ "grad_norm": 0.6945561766624451,
+ "learning_rate": 0.0001357779854299694,
+ "loss": 0.24048397541046143,
+ "mean_token_accuracy": 0.9195300146937371,
+ "num_tokens": 4622316.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.926525529265255,
+ "eval_entropy": 0.38581624263247777,
+ "eval_loss": 0.6029234528541565,
+ "eval_mean_token_accuracy": 0.8514213260523108,
+ "eval_num_tokens": 4622316.0,
+ "eval_runtime": 85.8729,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 1980
+ },
+ {
+ "entropy": 0.3051655298098922,
+ "epoch": 4.976338729763388,
+ "grad_norm": 0.7976452708244324,
+ "learning_rate": 0.00013384956622874001,
+ "loss": 0.23584742546081544,
+ "mean_token_accuracy": 0.9216851457953453,
+ "num_tokens": 4670746.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.976338729763388,
+ "eval_entropy": 0.37913159246361533,
+ "eval_loss": 0.6057604551315308,
+ "eval_mean_token_accuracy": 0.8525801203971686,
+ "eval_num_tokens": 4670746.0,
+ "eval_runtime": 86.1145,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2000
+ },
+ {
+ "entropy": 0.27438195240803254,
+ "epoch": 5.024906600249066,
+ "grad_norm": 0.6729586124420166,
+ "learning_rate": 0.0001319149012229075,
+ "loss": 0.19775952100753785,
+ "mean_token_accuracy": 0.9339428559327737,
+ "num_tokens": 4716176.0,
+ "step": 2020
+ },
+ {
+ "epoch": 5.024906600249066,
+ "eval_entropy": 0.3448961910813354,
+ "eval_loss": 0.6750120520591736,
+ "eval_mean_token_accuracy": 0.8487970232963562,
+ "eval_num_tokens": 4716176.0,
+ "eval_runtime": 86.1169,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2020
+ },
+ {
+ "entropy": 0.21423916313797237,
+ "epoch": 5.074719800747198,
+ "grad_norm": 0.6934391856193542,
+ "learning_rate": 0.00012997457388105022,
+ "loss": 0.1439570426940918,
+ "mean_token_accuracy": 0.9528236843645572,
+ "num_tokens": 4763269.0,
+ "step": 2040
+ },
+ {
+ "epoch": 5.074719800747198,
+ "eval_entropy": 0.3570949243771475,
+ "eval_loss": 0.6465504169464111,
+ "eval_mean_token_accuracy": 0.8490785547467166,
+ "eval_num_tokens": 4763269.0,
+ "eval_runtime": 85.9574,
+ "eval_samples_per_second": 15.996,
+ "eval_steps_per_second": 2.001,
+ "step": 2040
+ },
+ {
+ "entropy": 0.20838565267622472,
+ "epoch": 5.12453300124533,
+ "grad_norm": 0.7286986112594604,
+ "learning_rate": 0.00012802916937942972,
+ "loss": 0.14467307329177856,
+ "mean_token_accuracy": 0.950994835793972,
+ "num_tokens": 4809047.0,
+ "step": 2060
+ },
+ {
+ "epoch": 5.12453300124533,
+ "eval_entropy": 0.3452463157821533,
+ "eval_loss": 0.6705958843231201,
+ "eval_mean_token_accuracy": 0.8490352796953778,
+ "eval_num_tokens": 4809047.0,
+ "eval_runtime": 86.228,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 2060
+ },
+ {
+ "entropy": 0.20453082229942082,
+ "epoch": 5.174346201743462,
+ "grad_norm": 0.7515555620193481,
+ "learning_rate": 0.00012607927442550974,
+ "loss": 0.13732000589370727,
+ "mean_token_accuracy": 0.9537357829511166,
+ "num_tokens": 4857965.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.174346201743462,
+ "eval_entropy": 0.32431264914745506,
+ "eval_loss": 0.6743043065071106,
+ "eval_mean_token_accuracy": 0.8504878629085629,
+ "eval_num_tokens": 4857965.0,
+ "eval_runtime": 86.5948,
+ "eval_samples_per_second": 15.879,
+ "eval_steps_per_second": 1.986,
+ "step": 2080
+ },
+ {
+ "entropy": 0.21812320686876774,
+ "epoch": 5.224159402241594,
+ "grad_norm": 0.9093465209007263,
+ "learning_rate": 0.0001241254770810132,
+ "loss": 0.14311420917510986,
+ "mean_token_accuracy": 0.9514068141579628,
+ "num_tokens": 4905151.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.224159402241594,
+ "eval_entropy": 0.33086285835435225,
+ "eval_loss": 0.6676449179649353,
+ "eval_mean_token_accuracy": 0.8505287662495015,
+ "eval_num_tokens": 4905151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 2100
+ },
+ {
+ "entropy": 0.2180163251236081,
+ "epoch": 5.273972602739726,
+ "grad_norm": 0.6703007221221924,
+ "learning_rate": 0.00012216836658457075,
+ "loss": 0.14803968667984008,
+ "mean_token_accuracy": 0.9521303348243236,
+ "num_tokens": 4947072.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.273972602739726,
+ "eval_entropy": 0.33162341708707255,
+ "eval_loss": 0.6658875942230225,
+ "eval_mean_token_accuracy": 0.8500757605530495,
+ "eval_num_tokens": 4947072.0,
+ "eval_runtime": 86.6296,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 2120
+ },
+ {
+ "entropy": 0.22511130161583423,
+ "epoch": 5.323785803237858,
+ "grad_norm": 0.8078880906105042,
+ "learning_rate": 0.00012020853317401455,
+ "loss": 0.15228408575057983,
+ "mean_token_accuracy": 0.947144789993763,
+ "num_tokens": 4991974.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.323785803237858,
+ "eval_entropy": 0.3354601170434508,
+ "eval_loss": 0.6677829623222351,
+ "eval_mean_token_accuracy": 0.8482600024273229,
+ "eval_num_tokens": 4991974.0,
+ "eval_runtime": 86.4689,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.989,
+ "step": 2140
+ },
+ {
+ "entropy": 0.2244176059961319,
+ "epoch": 5.37359900373599,
+ "grad_norm": 0.9636075496673584,
+ "learning_rate": 0.00011824656790837037,
+ "loss": 0.15260883569717407,
+ "mean_token_accuracy": 0.9471467643976211,
+ "num_tokens": 5038400.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.37359900373599,
+ "eval_entropy": 0.3381616926297199,
+ "eval_loss": 0.6694412231445312,
+ "eval_mean_token_accuracy": 0.8482369603805764,
+ "eval_num_tokens": 5038400.0,
+ "eval_runtime": 86.4147,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 2160
+ },
+ {
+ "entropy": 0.22982364390045404,
+ "epoch": 5.423412204234122,
+ "grad_norm": 0.775401771068573,
+ "learning_rate": 0.00011628306248960262,
+ "loss": 0.15140302181243898,
+ "mean_token_accuracy": 0.9492553934454918,
+ "num_tokens": 5083166.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.423412204234122,
+ "eval_entropy": 0.3305150235808173,
+ "eval_loss": 0.6717822551727295,
+ "eval_mean_token_accuracy": 0.8489849723355715,
+ "eval_num_tokens": 5083166.0,
+ "eval_runtime": 86.4728,
+ "eval_samples_per_second": 15.901,
+ "eval_steps_per_second": 1.989,
+ "step": 2180
+ },
+ {
+ "entropy": 0.21448935717344284,
+ "epoch": 5.473225404732254,
+ "grad_norm": 0.6575281023979187,
+ "learning_rate": 0.00011431860908416465,
+ "loss": 0.1452319622039795,
+ "mean_token_accuracy": 0.9505287684500218,
+ "num_tokens": 5135109.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.473225404732254,
+ "eval_entropy": 0.3488145174328671,
+ "eval_loss": 0.6612305641174316,
+ "eval_mean_token_accuracy": 0.8492907808963642,
+ "eval_num_tokens": 5135109.0,
+ "eval_runtime": 86.6927,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 2200
+ },
+ {
+ "entropy": 0.23091202937066554,
+ "epoch": 5.523038605230386,
+ "grad_norm": 0.8909686207771301,
+ "learning_rate": 0.00011235380014440985,
+ "loss": 0.15150139331817628,
+ "mean_token_accuracy": 0.9497875183820724,
+ "num_tokens": 5180138.0,
+ "step": 2220
+ },
+ {
+ "epoch": 5.523038605230386,
+ "eval_entropy": 0.3268539015810157,
+ "eval_loss": 0.6667542457580566,
+ "eval_mean_token_accuracy": 0.8499062903398691,
+ "eval_num_tokens": 5180138.0,
+ "eval_runtime": 86.4644,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 2220
+ },
+ {
+ "entropy": 0.2227974807843566,
+ "epoch": 5.572851805728518,
+ "grad_norm": 0.6180275082588196,
+ "learning_rate": 0.0001103892282299158,
+ "loss": 0.1491069197654724,
+ "mean_token_accuracy": 0.9488144010305405,
+ "num_tokens": 5226864.0,
+ "step": 2240
+ },
+ {
+ "epoch": 5.572851805728518,
+ "eval_entropy": 0.3346347655494546,
+ "eval_loss": 0.6665948629379272,
+ "eval_mean_token_accuracy": 0.8499961893918903,
+ "eval_num_tokens": 5226864.0,
+ "eval_runtime": 87.0548,
+ "eval_samples_per_second": 15.795,
+ "eval_steps_per_second": 1.976,
+ "step": 2240
+ },
+ {
+ "entropy": 0.21368421968072654,
+ "epoch": 5.62266500622665,
+ "grad_norm": 0.6004369258880615,
+ "learning_rate": 0.00010842548582877651,
+ "loss": 0.14485255479812623,
+ "mean_token_accuracy": 0.9502056457102299,
+ "num_tokens": 5276602.0,
+ "step": 2260
+ },
+ {
+ "epoch": 5.62266500622665,
+ "eval_entropy": 0.32753298804163933,
+ "eval_loss": 0.6680151224136353,
+ "eval_mean_token_accuracy": 0.8515451086121936,
+ "eval_num_tokens": 5276602.0,
+ "eval_runtime": 86.8524,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.98,
+ "step": 2260
+ },
+ {
+ "entropy": 0.2103635374456644,
+ "epoch": 5.672478206724782,
+ "grad_norm": 0.699174702167511,
+ "learning_rate": 0.00010646316517891613,
+ "loss": 0.14297772645950318,
+ "mean_token_accuracy": 0.9512537539005279,
+ "num_tokens": 5323718.0,
+ "step": 2280
+ },
+ {
+ "epoch": 5.672478206724782,
+ "eval_entropy": 0.32966585959806,
+ "eval_loss": 0.675578773021698,
+ "eval_mean_token_accuracy": 0.8509623023659684,
+ "eval_num_tokens": 5323718.0,
+ "eval_runtime": 86.4518,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2280
+ },
+ {
+ "entropy": 0.22516900151968003,
+ "epoch": 5.722291407222914,
+ "grad_norm": 0.6637354493141174,
+ "learning_rate": 0.00010450285808947797,
+ "loss": 0.15202572345733642,
+ "mean_token_accuracy": 0.9482452072203159,
+ "num_tokens": 5369039.0,
+ "step": 2300
+ },
+ {
+ "epoch": 5.722291407222914,
+ "eval_entropy": 0.3369456917740578,
+ "eval_loss": 0.6697061061859131,
+ "eval_mean_token_accuracy": 0.848603522361711,
+ "eval_num_tokens": 5369039.0,
+ "eval_runtime": 86.6371,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.985,
+ "step": 2300
+ },
+ {
+ "entropy": 0.21841065725311637,
+ "epoch": 5.772104607721046,
+ "grad_norm": 0.7940268516540527,
+ "learning_rate": 0.00010254515576234297,
+ "loss": 0.14710167646408082,
+ "mean_token_accuracy": 0.9493498183786869,
+ "num_tokens": 5417029.0,
+ "step": 2320
+ },
+ {
+ "epoch": 5.772104607721046,
+ "eval_entropy": 0.3237486180177955,
+ "eval_loss": 0.6779657602310181,
+ "eval_mean_token_accuracy": 0.8500715313955794,
+ "eval_num_tokens": 5417029.0,
+ "eval_runtime": 86.1826,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 1.996,
+ "step": 2320
+ },
+ {
+ "entropy": 0.22146204356104135,
+ "epoch": 5.821917808219178,
+ "grad_norm": 0.9234833121299744,
+ "learning_rate": 0.00010059064861383132,
+ "loss": 0.14720046520233154,
+ "mean_token_accuracy": 0.9493872679769992,
+ "num_tokens": 5461671.0,
+ "step": 2340
+ },
+ {
+ "epoch": 5.821917808219178,
+ "eval_entropy": 0.32365207564692167,
+ "eval_loss": 0.6704005002975464,
+ "eval_mean_token_accuracy": 0.8507985760306203,
+ "eval_num_tokens": 5461671.0,
+ "eval_runtime": 86.5494,
+ "eval_samples_per_second": 15.887,
+ "eval_steps_per_second": 1.987,
+ "step": 2340
+ },
+ {
+ "entropy": 0.20934011954814197,
+ "epoch": 5.87173100871731,
+ "grad_norm": 0.5547503232955933,
+ "learning_rate": 9.863992609664084e-05,
+ "loss": 0.1464867353439331,
+ "mean_token_accuracy": 0.9503875687718392,
+ "num_tokens": 5509312.0,
+ "step": 2360
+ },
+ {
+ "epoch": 5.87173100871731,
+ "eval_entropy": 0.3330401429083458,
+ "eval_loss": 0.6659091114997864,
+ "eval_mean_token_accuracy": 0.8504848906467127,
+ "eval_num_tokens": 5509312.0,
+ "eval_runtime": 86.5855,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 2360
+ },
+ {
+ "entropy": 0.21678635366261007,
+ "epoch": 5.921544209215442,
+ "grad_norm": 0.570612907409668,
+ "learning_rate": 9.669357652207635e-05,
+ "loss": 0.14821385145187377,
+ "mean_token_accuracy": 0.9503940217196941,
+ "num_tokens": 5558196.0,
+ "step": 2380
+ },
+ {
+ "epoch": 5.921544209215442,
+ "eval_entropy": 0.3322022325077722,
+ "eval_loss": 0.6722489595413208,
+ "eval_mean_token_accuracy": 0.8489979422369669,
+ "eval_num_tokens": 5558196.0,
+ "eval_runtime": 86.2986,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 2380
+ },
+ {
+ "entropy": 0.20932920072227718,
+ "epoch": 5.971357409713574,
+ "grad_norm": 0.7879557609558105,
+ "learning_rate": 9.475218688262262e-05,
+ "loss": 0.14675841331481934,
+ "mean_token_accuracy": 0.9507176131010056,
+ "num_tokens": 5605400.0,
+ "step": 2400
+ },
+ {
+ "epoch": 5.971357409713574,
+ "eval_entropy": 0.3199348642902319,
+ "eval_loss": 0.6698136329650879,
+ "eval_mean_token_accuracy": 0.8514142130003419,
+ "eval_num_tokens": 5605400.0,
+ "eval_runtime": 85.8995,
+ "eval_samples_per_second": 16.007,
+ "eval_steps_per_second": 2.002,
+ "step": 2400
+ },
+ {
+ "entropy": 0.21032143919131693,
+ "epoch": 6.019925280199253,
+ "grad_norm": 0.5823076367378235,
+ "learning_rate": 9.281634267491569e-05,
+ "loss": 0.13322267532348633,
+ "mean_token_accuracy": 0.9550939072401096,
+ "num_tokens": 5648968.0,
+ "step": 2420
+ },
+ {
+ "epoch": 6.019925280199253,
+ "eval_entropy": 0.30206270117399303,
+ "eval_loss": 0.7093168497085571,
+ "eval_mean_token_accuracy": 0.8500627639681794,
+ "eval_num_tokens": 5648968.0,
+ "eval_runtime": 85.8128,
+ "eval_samples_per_second": 16.023,
+ "eval_steps_per_second": 2.004,
+ "step": 2420
+ },
+ {
+ "entropy": 0.1534628233872354,
+ "epoch": 6.069738480697385,
+ "grad_norm": 0.710133969783783,
+ "learning_rate": 9.088662772316508e-05,
+ "loss": 0.09078952670097351,
+ "mean_token_accuracy": 0.9678447999060154,
+ "num_tokens": 5697633.0,
+ "step": 2440
+ },
+ {
+ "epoch": 6.069738480697385,
+ "eval_entropy": 0.28208133101809857,
+ "eval_loss": 0.7636417150497437,
+ "eval_mean_token_accuracy": 0.8494061477655588,
+ "eval_num_tokens": 5697633.0,
+ "eval_runtime": 85.9724,
+ "eval_samples_per_second": 15.994,
+ "eval_steps_per_second": 2.001,
+ "step": 2440
+ },
+ {
+ "entropy": 0.16151462448760867,
+ "epoch": 6.119551681195516,
+ "grad_norm": 0.5793812274932861,
+ "learning_rate": 8.896362400308028e-05,
+ "loss": 0.09545697569847107,
+ "mean_token_accuracy": 0.9671573750674725,
+ "num_tokens": 5745090.0,
+ "step": 2460
+ },
+ {
+ "epoch": 6.119551681195516,
+ "eval_entropy": 0.2833245605403601,
+ "eval_loss": 0.7402405738830566,
+ "eval_mean_token_accuracy": 0.8503523728875226,
+ "eval_num_tokens": 5745090.0,
+ "eval_runtime": 85.5461,
+ "eval_samples_per_second": 16.073,
+ "eval_steps_per_second": 2.011,
+ "step": 2460
+ },
+ {
+ "entropy": 0.15203177919611335,
+ "epoch": 6.169364881693649,
+ "grad_norm": 0.4251123368740082,
+ "learning_rate": 8.704791146635483e-05,
+ "loss": 0.09420782327651978,
+ "mean_token_accuracy": 0.9677386932075024,
+ "num_tokens": 5790333.0,
+ "step": 2480
+ },
+ {
+ "epoch": 6.169364881693649,
+ "eval_entropy": 0.28572545962971313,
+ "eval_loss": 0.735416829586029,
+ "eval_mean_token_accuracy": 0.8487084663884584,
+ "eval_num_tokens": 5790333.0,
+ "eval_runtime": 85.4801,
+ "eval_samples_per_second": 16.086,
+ "eval_steps_per_second": 2.012,
+ "step": 2480
+ },
+ {
+ "entropy": 0.15587336672469973,
+ "epoch": 6.219178082191781,
+ "grad_norm": 0.4357028007507324,
+ "learning_rate": 8.514006786576085e-05,
+ "loss": 0.09429320096969604,
+ "mean_token_accuracy": 0.9682952925562859,
+ "num_tokens": 5837321.0,
+ "step": 2500
+ },
+ {
+ "epoch": 6.219178082191781,
+ "eval_entropy": 0.2859006894882335,
+ "eval_loss": 0.7347224950790405,
+ "eval_mean_token_accuracy": 0.8501905518215757,
+ "eval_num_tokens": 5837321.0,
+ "eval_runtime": 85.7578,
+ "eval_samples_per_second": 16.034,
+ "eval_steps_per_second": 2.006,
+ "step": 2500
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.4654087754485965e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2520/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2520/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2520/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2520/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2520/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2520/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2520/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2520/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2520/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2520/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2520/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2520/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2520/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2520/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..e3f50ff4fd4c6ccba0b4444c2fe71d1305c10582
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2520/trainer_state.json
@@ -0,0 +1,2680 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 6.268991282689913,
+ "eval_steps": 20,
+ "global_step": 2520,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ },
+ {
+ "entropy": 0.3193941755220294,
+ "epoch": 4.5280199252802,
+ "grad_norm": 0.8281906843185425,
+ "learning_rate": 0.0001509111761786888,
+ "loss": 0.23936262130737304,
+ "mean_token_accuracy": 0.9201708927750587,
+ "num_tokens": 4244423.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.5280199252802,
+ "eval_entropy": 0.38704028864239537,
+ "eval_loss": 0.6006569266319275,
+ "eval_mean_token_accuracy": 0.8502406720505205,
+ "eval_num_tokens": 4244423.0,
+ "eval_runtime": 86.8059,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1820
+ },
+ {
+ "entropy": 0.3164879363030195,
+ "epoch": 4.577833125778331,
+ "grad_norm": 0.7892968654632568,
+ "learning_rate": 0.00014905346557909867,
+ "loss": 0.24541733264923096,
+ "mean_token_accuracy": 0.9175932116806507,
+ "num_tokens": 4289773.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.577833125778331,
+ "eval_entropy": 0.38861122120951497,
+ "eval_loss": 0.6115967631340027,
+ "eval_mean_token_accuracy": 0.849471275196519,
+ "eval_num_tokens": 4289773.0,
+ "eval_runtime": 86.2946,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1840
+ },
+ {
+ "entropy": 0.3051785985007882,
+ "epoch": 4.627646326276463,
+ "grad_norm": 0.8109654188156128,
+ "learning_rate": 0.0001471849238862319,
+ "loss": 0.23433220386505127,
+ "mean_token_accuracy": 0.9206570319831371,
+ "num_tokens": 4336894.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.627646326276463,
+ "eval_entropy": 0.37162452295076015,
+ "eval_loss": 0.6184061765670776,
+ "eval_mean_token_accuracy": 0.8501173268223918,
+ "eval_num_tokens": 4336894.0,
+ "eval_runtime": 86.6865,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1860
+ },
+ {
+ "entropy": 0.3168198253959417,
+ "epoch": 4.677459526774595,
+ "grad_norm": 0.9512342214584351,
+ "learning_rate": 0.0001453061146267775,
+ "loss": 0.23832404613494873,
+ "mean_token_accuracy": 0.9197044663131237,
+ "num_tokens": 4382947.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.677459526774595,
+ "eval_entropy": 0.3845940856912801,
+ "eval_loss": 0.606762707233429,
+ "eval_mean_token_accuracy": 0.8504838194957999,
+ "eval_num_tokens": 4382947.0,
+ "eval_runtime": 86.5175,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 1880
+ },
+ {
+ "entropy": 0.30791807882487776,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 0.8123113512992859,
+ "learning_rate": 0.00014341760442398248,
+ "loss": 0.2395785331726074,
+ "mean_token_accuracy": 0.918928150832653,
+ "num_tokens": 4433050.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.7272727272727275,
+ "eval_entropy": 0.39762327222283494,
+ "eval_loss": 0.5994202494621277,
+ "eval_mean_token_accuracy": 0.8509274201337681,
+ "eval_num_tokens": 4433050.0,
+ "eval_runtime": 86.2873,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.993,
+ "step": 1900
+ },
+ {
+ "entropy": 0.3021434534341097,
+ "epoch": 4.777085927770859,
+ "grad_norm": 0.731787383556366,
+ "learning_rate": 0.000141519962826766,
+ "loss": 0.23494718074798585,
+ "mean_token_accuracy": 0.9201403826475143,
+ "num_tokens": 4483598.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.777085927770859,
+ "eval_entropy": 0.3827026732439219,
+ "eval_loss": 0.5995895862579346,
+ "eval_mean_token_accuracy": 0.851468373523202,
+ "eval_num_tokens": 4483598.0,
+ "eval_runtime": 86.3006,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 1920
+ },
+ {
+ "entropy": 0.31626159623265265,
+ "epoch": 4.826899128268991,
+ "grad_norm": 0.8848487138748169,
+ "learning_rate": 0.00013961376213795132,
+ "loss": 0.2439030647277832,
+ "mean_token_accuracy": 0.9196575872600079,
+ "num_tokens": 4529201.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.826899128268991,
+ "eval_entropy": 0.388698436839636,
+ "eval_loss": 0.6000174283981323,
+ "eval_mean_token_accuracy": 0.8518068187458571,
+ "eval_num_tokens": 4529201.0,
+ "eval_runtime": 86.8979,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.979,
+ "step": 1940
+ },
+ {
+ "entropy": 0.30520407035946845,
+ "epoch": 4.876712328767123,
+ "grad_norm": 0.8532460927963257,
+ "learning_rate": 0.00013769957724166695,
+ "loss": 0.23458616733551024,
+ "mean_token_accuracy": 0.9221912942826748,
+ "num_tokens": 4578167.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.876712328767123,
+ "eval_entropy": 0.38777847102908203,
+ "eval_loss": 0.6004981398582458,
+ "eval_mean_token_accuracy": 0.8516481768253238,
+ "eval_num_tokens": 4578167.0,
+ "eval_runtime": 87.0777,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.975,
+ "step": 1960
+ },
+ {
+ "entropy": 0.3226448342204094,
+ "epoch": 4.926525529265255,
+ "grad_norm": 0.6945561766624451,
+ "learning_rate": 0.0001357779854299694,
+ "loss": 0.24048397541046143,
+ "mean_token_accuracy": 0.9195300146937371,
+ "num_tokens": 4622316.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.926525529265255,
+ "eval_entropy": 0.38581624263247777,
+ "eval_loss": 0.6029234528541565,
+ "eval_mean_token_accuracy": 0.8514213260523108,
+ "eval_num_tokens": 4622316.0,
+ "eval_runtime": 85.8729,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 1980
+ },
+ {
+ "entropy": 0.3051655298098922,
+ "epoch": 4.976338729763388,
+ "grad_norm": 0.7976452708244324,
+ "learning_rate": 0.00013384956622874001,
+ "loss": 0.23584742546081544,
+ "mean_token_accuracy": 0.9216851457953453,
+ "num_tokens": 4670746.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.976338729763388,
+ "eval_entropy": 0.37913159246361533,
+ "eval_loss": 0.6057604551315308,
+ "eval_mean_token_accuracy": 0.8525801203971686,
+ "eval_num_tokens": 4670746.0,
+ "eval_runtime": 86.1145,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2000
+ },
+ {
+ "entropy": 0.27438195240803254,
+ "epoch": 5.024906600249066,
+ "grad_norm": 0.6729586124420166,
+ "learning_rate": 0.0001319149012229075,
+ "loss": 0.19775952100753785,
+ "mean_token_accuracy": 0.9339428559327737,
+ "num_tokens": 4716176.0,
+ "step": 2020
+ },
+ {
+ "epoch": 5.024906600249066,
+ "eval_entropy": 0.3448961910813354,
+ "eval_loss": 0.6750120520591736,
+ "eval_mean_token_accuracy": 0.8487970232963562,
+ "eval_num_tokens": 4716176.0,
+ "eval_runtime": 86.1169,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2020
+ },
+ {
+ "entropy": 0.21423916313797237,
+ "epoch": 5.074719800747198,
+ "grad_norm": 0.6934391856193542,
+ "learning_rate": 0.00012997457388105022,
+ "loss": 0.1439570426940918,
+ "mean_token_accuracy": 0.9528236843645572,
+ "num_tokens": 4763269.0,
+ "step": 2040
+ },
+ {
+ "epoch": 5.074719800747198,
+ "eval_entropy": 0.3570949243771475,
+ "eval_loss": 0.6465504169464111,
+ "eval_mean_token_accuracy": 0.8490785547467166,
+ "eval_num_tokens": 4763269.0,
+ "eval_runtime": 85.9574,
+ "eval_samples_per_second": 15.996,
+ "eval_steps_per_second": 2.001,
+ "step": 2040
+ },
+ {
+ "entropy": 0.20838565267622472,
+ "epoch": 5.12453300124533,
+ "grad_norm": 0.7286986112594604,
+ "learning_rate": 0.00012802916937942972,
+ "loss": 0.14467307329177856,
+ "mean_token_accuracy": 0.950994835793972,
+ "num_tokens": 4809047.0,
+ "step": 2060
+ },
+ {
+ "epoch": 5.12453300124533,
+ "eval_entropy": 0.3452463157821533,
+ "eval_loss": 0.6705958843231201,
+ "eval_mean_token_accuracy": 0.8490352796953778,
+ "eval_num_tokens": 4809047.0,
+ "eval_runtime": 86.228,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 2060
+ },
+ {
+ "entropy": 0.20453082229942082,
+ "epoch": 5.174346201743462,
+ "grad_norm": 0.7515555620193481,
+ "learning_rate": 0.00012607927442550974,
+ "loss": 0.13732000589370727,
+ "mean_token_accuracy": 0.9537357829511166,
+ "num_tokens": 4857965.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.174346201743462,
+ "eval_entropy": 0.32431264914745506,
+ "eval_loss": 0.6743043065071106,
+ "eval_mean_token_accuracy": 0.8504878629085629,
+ "eval_num_tokens": 4857965.0,
+ "eval_runtime": 86.5948,
+ "eval_samples_per_second": 15.879,
+ "eval_steps_per_second": 1.986,
+ "step": 2080
+ },
+ {
+ "entropy": 0.21812320686876774,
+ "epoch": 5.224159402241594,
+ "grad_norm": 0.9093465209007263,
+ "learning_rate": 0.0001241254770810132,
+ "loss": 0.14311420917510986,
+ "mean_token_accuracy": 0.9514068141579628,
+ "num_tokens": 4905151.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.224159402241594,
+ "eval_entropy": 0.33086285835435225,
+ "eval_loss": 0.6676449179649353,
+ "eval_mean_token_accuracy": 0.8505287662495015,
+ "eval_num_tokens": 4905151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 2100
+ },
+ {
+ "entropy": 0.2180163251236081,
+ "epoch": 5.273972602739726,
+ "grad_norm": 0.6703007221221924,
+ "learning_rate": 0.00012216836658457075,
+ "loss": 0.14803968667984008,
+ "mean_token_accuracy": 0.9521303348243236,
+ "num_tokens": 4947072.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.273972602739726,
+ "eval_entropy": 0.33162341708707255,
+ "eval_loss": 0.6658875942230225,
+ "eval_mean_token_accuracy": 0.8500757605530495,
+ "eval_num_tokens": 4947072.0,
+ "eval_runtime": 86.6296,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 2120
+ },
+ {
+ "entropy": 0.22511130161583423,
+ "epoch": 5.323785803237858,
+ "grad_norm": 0.8078880906105042,
+ "learning_rate": 0.00012020853317401455,
+ "loss": 0.15228408575057983,
+ "mean_token_accuracy": 0.947144789993763,
+ "num_tokens": 4991974.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.323785803237858,
+ "eval_entropy": 0.3354601170434508,
+ "eval_loss": 0.6677829623222351,
+ "eval_mean_token_accuracy": 0.8482600024273229,
+ "eval_num_tokens": 4991974.0,
+ "eval_runtime": 86.4689,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.989,
+ "step": 2140
+ },
+ {
+ "entropy": 0.2244176059961319,
+ "epoch": 5.37359900373599,
+ "grad_norm": 0.9636075496673584,
+ "learning_rate": 0.00011824656790837037,
+ "loss": 0.15260883569717407,
+ "mean_token_accuracy": 0.9471467643976211,
+ "num_tokens": 5038400.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.37359900373599,
+ "eval_entropy": 0.3381616926297199,
+ "eval_loss": 0.6694412231445312,
+ "eval_mean_token_accuracy": 0.8482369603805764,
+ "eval_num_tokens": 5038400.0,
+ "eval_runtime": 86.4147,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 2160
+ },
+ {
+ "entropy": 0.22982364390045404,
+ "epoch": 5.423412204234122,
+ "grad_norm": 0.775401771068573,
+ "learning_rate": 0.00011628306248960262,
+ "loss": 0.15140302181243898,
+ "mean_token_accuracy": 0.9492553934454918,
+ "num_tokens": 5083166.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.423412204234122,
+ "eval_entropy": 0.3305150235808173,
+ "eval_loss": 0.6717822551727295,
+ "eval_mean_token_accuracy": 0.8489849723355715,
+ "eval_num_tokens": 5083166.0,
+ "eval_runtime": 86.4728,
+ "eval_samples_per_second": 15.901,
+ "eval_steps_per_second": 1.989,
+ "step": 2180
+ },
+ {
+ "entropy": 0.21448935717344284,
+ "epoch": 5.473225404732254,
+ "grad_norm": 0.6575281023979187,
+ "learning_rate": 0.00011431860908416465,
+ "loss": 0.1452319622039795,
+ "mean_token_accuracy": 0.9505287684500218,
+ "num_tokens": 5135109.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.473225404732254,
+ "eval_entropy": 0.3488145174328671,
+ "eval_loss": 0.6612305641174316,
+ "eval_mean_token_accuracy": 0.8492907808963642,
+ "eval_num_tokens": 5135109.0,
+ "eval_runtime": 86.6927,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 2200
+ },
+ {
+ "entropy": 0.23091202937066554,
+ "epoch": 5.523038605230386,
+ "grad_norm": 0.8909686207771301,
+ "learning_rate": 0.00011235380014440985,
+ "loss": 0.15150139331817628,
+ "mean_token_accuracy": 0.9497875183820724,
+ "num_tokens": 5180138.0,
+ "step": 2220
+ },
+ {
+ "epoch": 5.523038605230386,
+ "eval_entropy": 0.3268539015810157,
+ "eval_loss": 0.6667542457580566,
+ "eval_mean_token_accuracy": 0.8499062903398691,
+ "eval_num_tokens": 5180138.0,
+ "eval_runtime": 86.4644,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 2220
+ },
+ {
+ "entropy": 0.2227974807843566,
+ "epoch": 5.572851805728518,
+ "grad_norm": 0.6180275082588196,
+ "learning_rate": 0.0001103892282299158,
+ "loss": 0.1491069197654724,
+ "mean_token_accuracy": 0.9488144010305405,
+ "num_tokens": 5226864.0,
+ "step": 2240
+ },
+ {
+ "epoch": 5.572851805728518,
+ "eval_entropy": 0.3346347655494546,
+ "eval_loss": 0.6665948629379272,
+ "eval_mean_token_accuracy": 0.8499961893918903,
+ "eval_num_tokens": 5226864.0,
+ "eval_runtime": 87.0548,
+ "eval_samples_per_second": 15.795,
+ "eval_steps_per_second": 1.976,
+ "step": 2240
+ },
+ {
+ "entropy": 0.21368421968072654,
+ "epoch": 5.62266500622665,
+ "grad_norm": 0.6004369258880615,
+ "learning_rate": 0.00010842548582877651,
+ "loss": 0.14485255479812623,
+ "mean_token_accuracy": 0.9502056457102299,
+ "num_tokens": 5276602.0,
+ "step": 2260
+ },
+ {
+ "epoch": 5.62266500622665,
+ "eval_entropy": 0.32753298804163933,
+ "eval_loss": 0.6680151224136353,
+ "eval_mean_token_accuracy": 0.8515451086121936,
+ "eval_num_tokens": 5276602.0,
+ "eval_runtime": 86.8524,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.98,
+ "step": 2260
+ },
+ {
+ "entropy": 0.2103635374456644,
+ "epoch": 5.672478206724782,
+ "grad_norm": 0.699174702167511,
+ "learning_rate": 0.00010646316517891613,
+ "loss": 0.14297772645950318,
+ "mean_token_accuracy": 0.9512537539005279,
+ "num_tokens": 5323718.0,
+ "step": 2280
+ },
+ {
+ "epoch": 5.672478206724782,
+ "eval_entropy": 0.32966585959806,
+ "eval_loss": 0.675578773021698,
+ "eval_mean_token_accuracy": 0.8509623023659684,
+ "eval_num_tokens": 5323718.0,
+ "eval_runtime": 86.4518,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2280
+ },
+ {
+ "entropy": 0.22516900151968003,
+ "epoch": 5.722291407222914,
+ "grad_norm": 0.6637354493141174,
+ "learning_rate": 0.00010450285808947797,
+ "loss": 0.15202572345733642,
+ "mean_token_accuracy": 0.9482452072203159,
+ "num_tokens": 5369039.0,
+ "step": 2300
+ },
+ {
+ "epoch": 5.722291407222914,
+ "eval_entropy": 0.3369456917740578,
+ "eval_loss": 0.6697061061859131,
+ "eval_mean_token_accuracy": 0.848603522361711,
+ "eval_num_tokens": 5369039.0,
+ "eval_runtime": 86.6371,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.985,
+ "step": 2300
+ },
+ {
+ "entropy": 0.21841065725311637,
+ "epoch": 5.772104607721046,
+ "grad_norm": 0.7940268516540527,
+ "learning_rate": 0.00010254515576234297,
+ "loss": 0.14710167646408082,
+ "mean_token_accuracy": 0.9493498183786869,
+ "num_tokens": 5417029.0,
+ "step": 2320
+ },
+ {
+ "epoch": 5.772104607721046,
+ "eval_entropy": 0.3237486180177955,
+ "eval_loss": 0.6779657602310181,
+ "eval_mean_token_accuracy": 0.8500715313955794,
+ "eval_num_tokens": 5417029.0,
+ "eval_runtime": 86.1826,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 1.996,
+ "step": 2320
+ },
+ {
+ "entropy": 0.22146204356104135,
+ "epoch": 5.821917808219178,
+ "grad_norm": 0.9234833121299744,
+ "learning_rate": 0.00010059064861383132,
+ "loss": 0.14720046520233154,
+ "mean_token_accuracy": 0.9493872679769992,
+ "num_tokens": 5461671.0,
+ "step": 2340
+ },
+ {
+ "epoch": 5.821917808219178,
+ "eval_entropy": 0.32365207564692167,
+ "eval_loss": 0.6704005002975464,
+ "eval_mean_token_accuracy": 0.8507985760306203,
+ "eval_num_tokens": 5461671.0,
+ "eval_runtime": 86.5494,
+ "eval_samples_per_second": 15.887,
+ "eval_steps_per_second": 1.987,
+ "step": 2340
+ },
+ {
+ "entropy": 0.20934011954814197,
+ "epoch": 5.87173100871731,
+ "grad_norm": 0.5547503232955933,
+ "learning_rate": 9.863992609664084e-05,
+ "loss": 0.1464867353439331,
+ "mean_token_accuracy": 0.9503875687718392,
+ "num_tokens": 5509312.0,
+ "step": 2360
+ },
+ {
+ "epoch": 5.87173100871731,
+ "eval_entropy": 0.3330401429083458,
+ "eval_loss": 0.6659091114997864,
+ "eval_mean_token_accuracy": 0.8504848906467127,
+ "eval_num_tokens": 5509312.0,
+ "eval_runtime": 86.5855,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 2360
+ },
+ {
+ "entropy": 0.21678635366261007,
+ "epoch": 5.921544209215442,
+ "grad_norm": 0.570612907409668,
+ "learning_rate": 9.669357652207635e-05,
+ "loss": 0.14821385145187377,
+ "mean_token_accuracy": 0.9503940217196941,
+ "num_tokens": 5558196.0,
+ "step": 2380
+ },
+ {
+ "epoch": 5.921544209215442,
+ "eval_entropy": 0.3322022325077722,
+ "eval_loss": 0.6722489595413208,
+ "eval_mean_token_accuracy": 0.8489979422369669,
+ "eval_num_tokens": 5558196.0,
+ "eval_runtime": 86.2986,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 2380
+ },
+ {
+ "entropy": 0.20932920072227718,
+ "epoch": 5.971357409713574,
+ "grad_norm": 0.7879557609558105,
+ "learning_rate": 9.475218688262262e-05,
+ "loss": 0.14675841331481934,
+ "mean_token_accuracy": 0.9507176131010056,
+ "num_tokens": 5605400.0,
+ "step": 2400
+ },
+ {
+ "epoch": 5.971357409713574,
+ "eval_entropy": 0.3199348642902319,
+ "eval_loss": 0.6698136329650879,
+ "eval_mean_token_accuracy": 0.8514142130003419,
+ "eval_num_tokens": 5605400.0,
+ "eval_runtime": 85.8995,
+ "eval_samples_per_second": 16.007,
+ "eval_steps_per_second": 2.002,
+ "step": 2400
+ },
+ {
+ "entropy": 0.21032143919131693,
+ "epoch": 6.019925280199253,
+ "grad_norm": 0.5823076367378235,
+ "learning_rate": 9.281634267491569e-05,
+ "loss": 0.13322267532348633,
+ "mean_token_accuracy": 0.9550939072401096,
+ "num_tokens": 5648968.0,
+ "step": 2420
+ },
+ {
+ "epoch": 6.019925280199253,
+ "eval_entropy": 0.30206270117399303,
+ "eval_loss": 0.7093168497085571,
+ "eval_mean_token_accuracy": 0.8500627639681794,
+ "eval_num_tokens": 5648968.0,
+ "eval_runtime": 85.8128,
+ "eval_samples_per_second": 16.023,
+ "eval_steps_per_second": 2.004,
+ "step": 2420
+ },
+ {
+ "entropy": 0.1534628233872354,
+ "epoch": 6.069738480697385,
+ "grad_norm": 0.710133969783783,
+ "learning_rate": 9.088662772316508e-05,
+ "loss": 0.09078952670097351,
+ "mean_token_accuracy": 0.9678447999060154,
+ "num_tokens": 5697633.0,
+ "step": 2440
+ },
+ {
+ "epoch": 6.069738480697385,
+ "eval_entropy": 0.28208133101809857,
+ "eval_loss": 0.7636417150497437,
+ "eval_mean_token_accuracy": 0.8494061477655588,
+ "eval_num_tokens": 5697633.0,
+ "eval_runtime": 85.9724,
+ "eval_samples_per_second": 15.994,
+ "eval_steps_per_second": 2.001,
+ "step": 2440
+ },
+ {
+ "entropy": 0.16151462448760867,
+ "epoch": 6.119551681195516,
+ "grad_norm": 0.5793812274932861,
+ "learning_rate": 8.896362400308028e-05,
+ "loss": 0.09545697569847107,
+ "mean_token_accuracy": 0.9671573750674725,
+ "num_tokens": 5745090.0,
+ "step": 2460
+ },
+ {
+ "epoch": 6.119551681195516,
+ "eval_entropy": 0.2833245605403601,
+ "eval_loss": 0.7402405738830566,
+ "eval_mean_token_accuracy": 0.8503523728875226,
+ "eval_num_tokens": 5745090.0,
+ "eval_runtime": 85.5461,
+ "eval_samples_per_second": 16.073,
+ "eval_steps_per_second": 2.011,
+ "step": 2460
+ },
+ {
+ "entropy": 0.15203177919611335,
+ "epoch": 6.169364881693649,
+ "grad_norm": 0.4251123368740082,
+ "learning_rate": 8.704791146635483e-05,
+ "loss": 0.09420782327651978,
+ "mean_token_accuracy": 0.9677386932075024,
+ "num_tokens": 5790333.0,
+ "step": 2480
+ },
+ {
+ "epoch": 6.169364881693649,
+ "eval_entropy": 0.28572545962971313,
+ "eval_loss": 0.735416829586029,
+ "eval_mean_token_accuracy": 0.8487084663884584,
+ "eval_num_tokens": 5790333.0,
+ "eval_runtime": 85.4801,
+ "eval_samples_per_second": 16.086,
+ "eval_steps_per_second": 2.012,
+ "step": 2480
+ },
+ {
+ "entropy": 0.15587336672469973,
+ "epoch": 6.219178082191781,
+ "grad_norm": 0.4357028007507324,
+ "learning_rate": 8.514006786576085e-05,
+ "loss": 0.09429320096969604,
+ "mean_token_accuracy": 0.9682952925562859,
+ "num_tokens": 5837321.0,
+ "step": 2500
+ },
+ {
+ "epoch": 6.219178082191781,
+ "eval_entropy": 0.2859006894882335,
+ "eval_loss": 0.7347224950790405,
+ "eval_mean_token_accuracy": 0.8501905518215757,
+ "eval_num_tokens": 5837321.0,
+ "eval_runtime": 85.7578,
+ "eval_samples_per_second": 16.034,
+ "eval_steps_per_second": 2.006,
+ "step": 2500
+ },
+ {
+ "entropy": 0.15765639198943973,
+ "epoch": 6.268991282689913,
+ "grad_norm": 0.47331130504608154,
+ "learning_rate": 8.324066858090663e-05,
+ "loss": 0.09571113586425781,
+ "mean_token_accuracy": 0.9683481335639954,
+ "num_tokens": 5884398.0,
+ "step": 2520
+ },
+ {
+ "epoch": 6.268991282689913,
+ "eval_entropy": 0.29231513846059176,
+ "eval_loss": 0.7392512559890747,
+ "eval_mean_token_accuracy": 0.8486633983462356,
+ "eval_num_tokens": 5884398.0,
+ "eval_runtime": 85.7846,
+ "eval_samples_per_second": 16.029,
+ "eval_steps_per_second": 2.005,
+ "step": 2520
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.484802811095634e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2540/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2540/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2540/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2540/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2540/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2540/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2540/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2540/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2540/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2540/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2540/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2540/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2540/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2540/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..d86bab92aa7674eaa65f51f312bca028f9f1df84
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2540/trainer_state.json
@@ -0,0 +1,2701 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 6.318804483188045,
+ "eval_steps": 20,
+ "global_step": 2540,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ },
+ {
+ "entropy": 0.3193941755220294,
+ "epoch": 4.5280199252802,
+ "grad_norm": 0.8281906843185425,
+ "learning_rate": 0.0001509111761786888,
+ "loss": 0.23936262130737304,
+ "mean_token_accuracy": 0.9201708927750587,
+ "num_tokens": 4244423.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.5280199252802,
+ "eval_entropy": 0.38704028864239537,
+ "eval_loss": 0.6006569266319275,
+ "eval_mean_token_accuracy": 0.8502406720505205,
+ "eval_num_tokens": 4244423.0,
+ "eval_runtime": 86.8059,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1820
+ },
+ {
+ "entropy": 0.3164879363030195,
+ "epoch": 4.577833125778331,
+ "grad_norm": 0.7892968654632568,
+ "learning_rate": 0.00014905346557909867,
+ "loss": 0.24541733264923096,
+ "mean_token_accuracy": 0.9175932116806507,
+ "num_tokens": 4289773.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.577833125778331,
+ "eval_entropy": 0.38861122120951497,
+ "eval_loss": 0.6115967631340027,
+ "eval_mean_token_accuracy": 0.849471275196519,
+ "eval_num_tokens": 4289773.0,
+ "eval_runtime": 86.2946,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1840
+ },
+ {
+ "entropy": 0.3051785985007882,
+ "epoch": 4.627646326276463,
+ "grad_norm": 0.8109654188156128,
+ "learning_rate": 0.0001471849238862319,
+ "loss": 0.23433220386505127,
+ "mean_token_accuracy": 0.9206570319831371,
+ "num_tokens": 4336894.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.627646326276463,
+ "eval_entropy": 0.37162452295076015,
+ "eval_loss": 0.6184061765670776,
+ "eval_mean_token_accuracy": 0.8501173268223918,
+ "eval_num_tokens": 4336894.0,
+ "eval_runtime": 86.6865,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1860
+ },
+ {
+ "entropy": 0.3168198253959417,
+ "epoch": 4.677459526774595,
+ "grad_norm": 0.9512342214584351,
+ "learning_rate": 0.0001453061146267775,
+ "loss": 0.23832404613494873,
+ "mean_token_accuracy": 0.9197044663131237,
+ "num_tokens": 4382947.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.677459526774595,
+ "eval_entropy": 0.3845940856912801,
+ "eval_loss": 0.606762707233429,
+ "eval_mean_token_accuracy": 0.8504838194957999,
+ "eval_num_tokens": 4382947.0,
+ "eval_runtime": 86.5175,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 1880
+ },
+ {
+ "entropy": 0.30791807882487776,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 0.8123113512992859,
+ "learning_rate": 0.00014341760442398248,
+ "loss": 0.2395785331726074,
+ "mean_token_accuracy": 0.918928150832653,
+ "num_tokens": 4433050.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.7272727272727275,
+ "eval_entropy": 0.39762327222283494,
+ "eval_loss": 0.5994202494621277,
+ "eval_mean_token_accuracy": 0.8509274201337681,
+ "eval_num_tokens": 4433050.0,
+ "eval_runtime": 86.2873,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.993,
+ "step": 1900
+ },
+ {
+ "entropy": 0.3021434534341097,
+ "epoch": 4.777085927770859,
+ "grad_norm": 0.731787383556366,
+ "learning_rate": 0.000141519962826766,
+ "loss": 0.23494718074798585,
+ "mean_token_accuracy": 0.9201403826475143,
+ "num_tokens": 4483598.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.777085927770859,
+ "eval_entropy": 0.3827026732439219,
+ "eval_loss": 0.5995895862579346,
+ "eval_mean_token_accuracy": 0.851468373523202,
+ "eval_num_tokens": 4483598.0,
+ "eval_runtime": 86.3006,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 1920
+ },
+ {
+ "entropy": 0.31626159623265265,
+ "epoch": 4.826899128268991,
+ "grad_norm": 0.8848487138748169,
+ "learning_rate": 0.00013961376213795132,
+ "loss": 0.2439030647277832,
+ "mean_token_accuracy": 0.9196575872600079,
+ "num_tokens": 4529201.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.826899128268991,
+ "eval_entropy": 0.388698436839636,
+ "eval_loss": 0.6000174283981323,
+ "eval_mean_token_accuracy": 0.8518068187458571,
+ "eval_num_tokens": 4529201.0,
+ "eval_runtime": 86.8979,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.979,
+ "step": 1940
+ },
+ {
+ "entropy": 0.30520407035946845,
+ "epoch": 4.876712328767123,
+ "grad_norm": 0.8532460927963257,
+ "learning_rate": 0.00013769957724166695,
+ "loss": 0.23458616733551024,
+ "mean_token_accuracy": 0.9221912942826748,
+ "num_tokens": 4578167.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.876712328767123,
+ "eval_entropy": 0.38777847102908203,
+ "eval_loss": 0.6004981398582458,
+ "eval_mean_token_accuracy": 0.8516481768253238,
+ "eval_num_tokens": 4578167.0,
+ "eval_runtime": 87.0777,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.975,
+ "step": 1960
+ },
+ {
+ "entropy": 0.3226448342204094,
+ "epoch": 4.926525529265255,
+ "grad_norm": 0.6945561766624451,
+ "learning_rate": 0.0001357779854299694,
+ "loss": 0.24048397541046143,
+ "mean_token_accuracy": 0.9195300146937371,
+ "num_tokens": 4622316.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.926525529265255,
+ "eval_entropy": 0.38581624263247777,
+ "eval_loss": 0.6029234528541565,
+ "eval_mean_token_accuracy": 0.8514213260523108,
+ "eval_num_tokens": 4622316.0,
+ "eval_runtime": 85.8729,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 1980
+ },
+ {
+ "entropy": 0.3051655298098922,
+ "epoch": 4.976338729763388,
+ "grad_norm": 0.7976452708244324,
+ "learning_rate": 0.00013384956622874001,
+ "loss": 0.23584742546081544,
+ "mean_token_accuracy": 0.9216851457953453,
+ "num_tokens": 4670746.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.976338729763388,
+ "eval_entropy": 0.37913159246361533,
+ "eval_loss": 0.6057604551315308,
+ "eval_mean_token_accuracy": 0.8525801203971686,
+ "eval_num_tokens": 4670746.0,
+ "eval_runtime": 86.1145,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2000
+ },
+ {
+ "entropy": 0.27438195240803254,
+ "epoch": 5.024906600249066,
+ "grad_norm": 0.6729586124420166,
+ "learning_rate": 0.0001319149012229075,
+ "loss": 0.19775952100753785,
+ "mean_token_accuracy": 0.9339428559327737,
+ "num_tokens": 4716176.0,
+ "step": 2020
+ },
+ {
+ "epoch": 5.024906600249066,
+ "eval_entropy": 0.3448961910813354,
+ "eval_loss": 0.6750120520591736,
+ "eval_mean_token_accuracy": 0.8487970232963562,
+ "eval_num_tokens": 4716176.0,
+ "eval_runtime": 86.1169,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2020
+ },
+ {
+ "entropy": 0.21423916313797237,
+ "epoch": 5.074719800747198,
+ "grad_norm": 0.6934391856193542,
+ "learning_rate": 0.00012997457388105022,
+ "loss": 0.1439570426940918,
+ "mean_token_accuracy": 0.9528236843645572,
+ "num_tokens": 4763269.0,
+ "step": 2040
+ },
+ {
+ "epoch": 5.074719800747198,
+ "eval_entropy": 0.3570949243771475,
+ "eval_loss": 0.6465504169464111,
+ "eval_mean_token_accuracy": 0.8490785547467166,
+ "eval_num_tokens": 4763269.0,
+ "eval_runtime": 85.9574,
+ "eval_samples_per_second": 15.996,
+ "eval_steps_per_second": 2.001,
+ "step": 2040
+ },
+ {
+ "entropy": 0.20838565267622472,
+ "epoch": 5.12453300124533,
+ "grad_norm": 0.7286986112594604,
+ "learning_rate": 0.00012802916937942972,
+ "loss": 0.14467307329177856,
+ "mean_token_accuracy": 0.950994835793972,
+ "num_tokens": 4809047.0,
+ "step": 2060
+ },
+ {
+ "epoch": 5.12453300124533,
+ "eval_entropy": 0.3452463157821533,
+ "eval_loss": 0.6705958843231201,
+ "eval_mean_token_accuracy": 0.8490352796953778,
+ "eval_num_tokens": 4809047.0,
+ "eval_runtime": 86.228,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 2060
+ },
+ {
+ "entropy": 0.20453082229942082,
+ "epoch": 5.174346201743462,
+ "grad_norm": 0.7515555620193481,
+ "learning_rate": 0.00012607927442550974,
+ "loss": 0.13732000589370727,
+ "mean_token_accuracy": 0.9537357829511166,
+ "num_tokens": 4857965.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.174346201743462,
+ "eval_entropy": 0.32431264914745506,
+ "eval_loss": 0.6743043065071106,
+ "eval_mean_token_accuracy": 0.8504878629085629,
+ "eval_num_tokens": 4857965.0,
+ "eval_runtime": 86.5948,
+ "eval_samples_per_second": 15.879,
+ "eval_steps_per_second": 1.986,
+ "step": 2080
+ },
+ {
+ "entropy": 0.21812320686876774,
+ "epoch": 5.224159402241594,
+ "grad_norm": 0.9093465209007263,
+ "learning_rate": 0.0001241254770810132,
+ "loss": 0.14311420917510986,
+ "mean_token_accuracy": 0.9514068141579628,
+ "num_tokens": 4905151.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.224159402241594,
+ "eval_entropy": 0.33086285835435225,
+ "eval_loss": 0.6676449179649353,
+ "eval_mean_token_accuracy": 0.8505287662495015,
+ "eval_num_tokens": 4905151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 2100
+ },
+ {
+ "entropy": 0.2180163251236081,
+ "epoch": 5.273972602739726,
+ "grad_norm": 0.6703007221221924,
+ "learning_rate": 0.00012216836658457075,
+ "loss": 0.14803968667984008,
+ "mean_token_accuracy": 0.9521303348243236,
+ "num_tokens": 4947072.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.273972602739726,
+ "eval_entropy": 0.33162341708707255,
+ "eval_loss": 0.6658875942230225,
+ "eval_mean_token_accuracy": 0.8500757605530495,
+ "eval_num_tokens": 4947072.0,
+ "eval_runtime": 86.6296,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 2120
+ },
+ {
+ "entropy": 0.22511130161583423,
+ "epoch": 5.323785803237858,
+ "grad_norm": 0.8078880906105042,
+ "learning_rate": 0.00012020853317401455,
+ "loss": 0.15228408575057983,
+ "mean_token_accuracy": 0.947144789993763,
+ "num_tokens": 4991974.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.323785803237858,
+ "eval_entropy": 0.3354601170434508,
+ "eval_loss": 0.6677829623222351,
+ "eval_mean_token_accuracy": 0.8482600024273229,
+ "eval_num_tokens": 4991974.0,
+ "eval_runtime": 86.4689,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.989,
+ "step": 2140
+ },
+ {
+ "entropy": 0.2244176059961319,
+ "epoch": 5.37359900373599,
+ "grad_norm": 0.9636075496673584,
+ "learning_rate": 0.00011824656790837037,
+ "loss": 0.15260883569717407,
+ "mean_token_accuracy": 0.9471467643976211,
+ "num_tokens": 5038400.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.37359900373599,
+ "eval_entropy": 0.3381616926297199,
+ "eval_loss": 0.6694412231445312,
+ "eval_mean_token_accuracy": 0.8482369603805764,
+ "eval_num_tokens": 5038400.0,
+ "eval_runtime": 86.4147,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 2160
+ },
+ {
+ "entropy": 0.22982364390045404,
+ "epoch": 5.423412204234122,
+ "grad_norm": 0.775401771068573,
+ "learning_rate": 0.00011628306248960262,
+ "loss": 0.15140302181243898,
+ "mean_token_accuracy": 0.9492553934454918,
+ "num_tokens": 5083166.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.423412204234122,
+ "eval_entropy": 0.3305150235808173,
+ "eval_loss": 0.6717822551727295,
+ "eval_mean_token_accuracy": 0.8489849723355715,
+ "eval_num_tokens": 5083166.0,
+ "eval_runtime": 86.4728,
+ "eval_samples_per_second": 15.901,
+ "eval_steps_per_second": 1.989,
+ "step": 2180
+ },
+ {
+ "entropy": 0.21448935717344284,
+ "epoch": 5.473225404732254,
+ "grad_norm": 0.6575281023979187,
+ "learning_rate": 0.00011431860908416465,
+ "loss": 0.1452319622039795,
+ "mean_token_accuracy": 0.9505287684500218,
+ "num_tokens": 5135109.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.473225404732254,
+ "eval_entropy": 0.3488145174328671,
+ "eval_loss": 0.6612305641174316,
+ "eval_mean_token_accuracy": 0.8492907808963642,
+ "eval_num_tokens": 5135109.0,
+ "eval_runtime": 86.6927,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 2200
+ },
+ {
+ "entropy": 0.23091202937066554,
+ "epoch": 5.523038605230386,
+ "grad_norm": 0.8909686207771301,
+ "learning_rate": 0.00011235380014440985,
+ "loss": 0.15150139331817628,
+ "mean_token_accuracy": 0.9497875183820724,
+ "num_tokens": 5180138.0,
+ "step": 2220
+ },
+ {
+ "epoch": 5.523038605230386,
+ "eval_entropy": 0.3268539015810157,
+ "eval_loss": 0.6667542457580566,
+ "eval_mean_token_accuracy": 0.8499062903398691,
+ "eval_num_tokens": 5180138.0,
+ "eval_runtime": 86.4644,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 2220
+ },
+ {
+ "entropy": 0.2227974807843566,
+ "epoch": 5.572851805728518,
+ "grad_norm": 0.6180275082588196,
+ "learning_rate": 0.0001103892282299158,
+ "loss": 0.1491069197654724,
+ "mean_token_accuracy": 0.9488144010305405,
+ "num_tokens": 5226864.0,
+ "step": 2240
+ },
+ {
+ "epoch": 5.572851805728518,
+ "eval_entropy": 0.3346347655494546,
+ "eval_loss": 0.6665948629379272,
+ "eval_mean_token_accuracy": 0.8499961893918903,
+ "eval_num_tokens": 5226864.0,
+ "eval_runtime": 87.0548,
+ "eval_samples_per_second": 15.795,
+ "eval_steps_per_second": 1.976,
+ "step": 2240
+ },
+ {
+ "entropy": 0.21368421968072654,
+ "epoch": 5.62266500622665,
+ "grad_norm": 0.6004369258880615,
+ "learning_rate": 0.00010842548582877651,
+ "loss": 0.14485255479812623,
+ "mean_token_accuracy": 0.9502056457102299,
+ "num_tokens": 5276602.0,
+ "step": 2260
+ },
+ {
+ "epoch": 5.62266500622665,
+ "eval_entropy": 0.32753298804163933,
+ "eval_loss": 0.6680151224136353,
+ "eval_mean_token_accuracy": 0.8515451086121936,
+ "eval_num_tokens": 5276602.0,
+ "eval_runtime": 86.8524,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.98,
+ "step": 2260
+ },
+ {
+ "entropy": 0.2103635374456644,
+ "epoch": 5.672478206724782,
+ "grad_norm": 0.699174702167511,
+ "learning_rate": 0.00010646316517891613,
+ "loss": 0.14297772645950318,
+ "mean_token_accuracy": 0.9512537539005279,
+ "num_tokens": 5323718.0,
+ "step": 2280
+ },
+ {
+ "epoch": 5.672478206724782,
+ "eval_entropy": 0.32966585959806,
+ "eval_loss": 0.675578773021698,
+ "eval_mean_token_accuracy": 0.8509623023659684,
+ "eval_num_tokens": 5323718.0,
+ "eval_runtime": 86.4518,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2280
+ },
+ {
+ "entropy": 0.22516900151968003,
+ "epoch": 5.722291407222914,
+ "grad_norm": 0.6637354493141174,
+ "learning_rate": 0.00010450285808947797,
+ "loss": 0.15202572345733642,
+ "mean_token_accuracy": 0.9482452072203159,
+ "num_tokens": 5369039.0,
+ "step": 2300
+ },
+ {
+ "epoch": 5.722291407222914,
+ "eval_entropy": 0.3369456917740578,
+ "eval_loss": 0.6697061061859131,
+ "eval_mean_token_accuracy": 0.848603522361711,
+ "eval_num_tokens": 5369039.0,
+ "eval_runtime": 86.6371,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.985,
+ "step": 2300
+ },
+ {
+ "entropy": 0.21841065725311637,
+ "epoch": 5.772104607721046,
+ "grad_norm": 0.7940268516540527,
+ "learning_rate": 0.00010254515576234297,
+ "loss": 0.14710167646408082,
+ "mean_token_accuracy": 0.9493498183786869,
+ "num_tokens": 5417029.0,
+ "step": 2320
+ },
+ {
+ "epoch": 5.772104607721046,
+ "eval_entropy": 0.3237486180177955,
+ "eval_loss": 0.6779657602310181,
+ "eval_mean_token_accuracy": 0.8500715313955794,
+ "eval_num_tokens": 5417029.0,
+ "eval_runtime": 86.1826,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 1.996,
+ "step": 2320
+ },
+ {
+ "entropy": 0.22146204356104135,
+ "epoch": 5.821917808219178,
+ "grad_norm": 0.9234833121299744,
+ "learning_rate": 0.00010059064861383132,
+ "loss": 0.14720046520233154,
+ "mean_token_accuracy": 0.9493872679769992,
+ "num_tokens": 5461671.0,
+ "step": 2340
+ },
+ {
+ "epoch": 5.821917808219178,
+ "eval_entropy": 0.32365207564692167,
+ "eval_loss": 0.6704005002975464,
+ "eval_mean_token_accuracy": 0.8507985760306203,
+ "eval_num_tokens": 5461671.0,
+ "eval_runtime": 86.5494,
+ "eval_samples_per_second": 15.887,
+ "eval_steps_per_second": 1.987,
+ "step": 2340
+ },
+ {
+ "entropy": 0.20934011954814197,
+ "epoch": 5.87173100871731,
+ "grad_norm": 0.5547503232955933,
+ "learning_rate": 9.863992609664084e-05,
+ "loss": 0.1464867353439331,
+ "mean_token_accuracy": 0.9503875687718392,
+ "num_tokens": 5509312.0,
+ "step": 2360
+ },
+ {
+ "epoch": 5.87173100871731,
+ "eval_entropy": 0.3330401429083458,
+ "eval_loss": 0.6659091114997864,
+ "eval_mean_token_accuracy": 0.8504848906467127,
+ "eval_num_tokens": 5509312.0,
+ "eval_runtime": 86.5855,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 2360
+ },
+ {
+ "entropy": 0.21678635366261007,
+ "epoch": 5.921544209215442,
+ "grad_norm": 0.570612907409668,
+ "learning_rate": 9.669357652207635e-05,
+ "loss": 0.14821385145187377,
+ "mean_token_accuracy": 0.9503940217196941,
+ "num_tokens": 5558196.0,
+ "step": 2380
+ },
+ {
+ "epoch": 5.921544209215442,
+ "eval_entropy": 0.3322022325077722,
+ "eval_loss": 0.6722489595413208,
+ "eval_mean_token_accuracy": 0.8489979422369669,
+ "eval_num_tokens": 5558196.0,
+ "eval_runtime": 86.2986,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 2380
+ },
+ {
+ "entropy": 0.20932920072227718,
+ "epoch": 5.971357409713574,
+ "grad_norm": 0.7879557609558105,
+ "learning_rate": 9.475218688262262e-05,
+ "loss": 0.14675841331481934,
+ "mean_token_accuracy": 0.9507176131010056,
+ "num_tokens": 5605400.0,
+ "step": 2400
+ },
+ {
+ "epoch": 5.971357409713574,
+ "eval_entropy": 0.3199348642902319,
+ "eval_loss": 0.6698136329650879,
+ "eval_mean_token_accuracy": 0.8514142130003419,
+ "eval_num_tokens": 5605400.0,
+ "eval_runtime": 85.8995,
+ "eval_samples_per_second": 16.007,
+ "eval_steps_per_second": 2.002,
+ "step": 2400
+ },
+ {
+ "entropy": 0.21032143919131693,
+ "epoch": 6.019925280199253,
+ "grad_norm": 0.5823076367378235,
+ "learning_rate": 9.281634267491569e-05,
+ "loss": 0.13322267532348633,
+ "mean_token_accuracy": 0.9550939072401096,
+ "num_tokens": 5648968.0,
+ "step": 2420
+ },
+ {
+ "epoch": 6.019925280199253,
+ "eval_entropy": 0.30206270117399303,
+ "eval_loss": 0.7093168497085571,
+ "eval_mean_token_accuracy": 0.8500627639681794,
+ "eval_num_tokens": 5648968.0,
+ "eval_runtime": 85.8128,
+ "eval_samples_per_second": 16.023,
+ "eval_steps_per_second": 2.004,
+ "step": 2420
+ },
+ {
+ "entropy": 0.1534628233872354,
+ "epoch": 6.069738480697385,
+ "grad_norm": 0.710133969783783,
+ "learning_rate": 9.088662772316508e-05,
+ "loss": 0.09078952670097351,
+ "mean_token_accuracy": 0.9678447999060154,
+ "num_tokens": 5697633.0,
+ "step": 2440
+ },
+ {
+ "epoch": 6.069738480697385,
+ "eval_entropy": 0.28208133101809857,
+ "eval_loss": 0.7636417150497437,
+ "eval_mean_token_accuracy": 0.8494061477655588,
+ "eval_num_tokens": 5697633.0,
+ "eval_runtime": 85.9724,
+ "eval_samples_per_second": 15.994,
+ "eval_steps_per_second": 2.001,
+ "step": 2440
+ },
+ {
+ "entropy": 0.16151462448760867,
+ "epoch": 6.119551681195516,
+ "grad_norm": 0.5793812274932861,
+ "learning_rate": 8.896362400308028e-05,
+ "loss": 0.09545697569847107,
+ "mean_token_accuracy": 0.9671573750674725,
+ "num_tokens": 5745090.0,
+ "step": 2460
+ },
+ {
+ "epoch": 6.119551681195516,
+ "eval_entropy": 0.2833245605403601,
+ "eval_loss": 0.7402405738830566,
+ "eval_mean_token_accuracy": 0.8503523728875226,
+ "eval_num_tokens": 5745090.0,
+ "eval_runtime": 85.5461,
+ "eval_samples_per_second": 16.073,
+ "eval_steps_per_second": 2.011,
+ "step": 2460
+ },
+ {
+ "entropy": 0.15203177919611335,
+ "epoch": 6.169364881693649,
+ "grad_norm": 0.4251123368740082,
+ "learning_rate": 8.704791146635483e-05,
+ "loss": 0.09420782327651978,
+ "mean_token_accuracy": 0.9677386932075024,
+ "num_tokens": 5790333.0,
+ "step": 2480
+ },
+ {
+ "epoch": 6.169364881693649,
+ "eval_entropy": 0.28572545962971313,
+ "eval_loss": 0.735416829586029,
+ "eval_mean_token_accuracy": 0.8487084663884584,
+ "eval_num_tokens": 5790333.0,
+ "eval_runtime": 85.4801,
+ "eval_samples_per_second": 16.086,
+ "eval_steps_per_second": 2.012,
+ "step": 2480
+ },
+ {
+ "entropy": 0.15587336672469973,
+ "epoch": 6.219178082191781,
+ "grad_norm": 0.4357028007507324,
+ "learning_rate": 8.514006786576085e-05,
+ "loss": 0.09429320096969604,
+ "mean_token_accuracy": 0.9682952925562859,
+ "num_tokens": 5837321.0,
+ "step": 2500
+ },
+ {
+ "epoch": 6.219178082191781,
+ "eval_entropy": 0.2859006894882335,
+ "eval_loss": 0.7347224950790405,
+ "eval_mean_token_accuracy": 0.8501905518215757,
+ "eval_num_tokens": 5837321.0,
+ "eval_runtime": 85.7578,
+ "eval_samples_per_second": 16.034,
+ "eval_steps_per_second": 2.006,
+ "step": 2500
+ },
+ {
+ "entropy": 0.15765639198943973,
+ "epoch": 6.268991282689913,
+ "grad_norm": 0.47331130504608154,
+ "learning_rate": 8.324066858090663e-05,
+ "loss": 0.09571113586425781,
+ "mean_token_accuracy": 0.9683481335639954,
+ "num_tokens": 5884398.0,
+ "step": 2520
+ },
+ {
+ "epoch": 6.268991282689913,
+ "eval_entropy": 0.29231513846059176,
+ "eval_loss": 0.7392512559890747,
+ "eval_mean_token_accuracy": 0.8486633983462356,
+ "eval_num_tokens": 5884398.0,
+ "eval_runtime": 85.7846,
+ "eval_samples_per_second": 16.029,
+ "eval_steps_per_second": 2.005,
+ "step": 2520
+ },
+ {
+ "entropy": 0.16176860257983208,
+ "epoch": 6.318804483188045,
+ "grad_norm": 0.6142018437385559,
+ "learning_rate": 8.135028644470992e-05,
+ "loss": 0.09486144185066223,
+ "mean_token_accuracy": 0.9682316601276397,
+ "num_tokens": 5929876.0,
+ "step": 2540
+ },
+ {
+ "epoch": 6.318804483188045,
+ "eval_entropy": 0.2851274753379267,
+ "eval_loss": 0.7520816922187805,
+ "eval_mean_token_accuracy": 0.8501113649717597,
+ "eval_num_tokens": 5929876.0,
+ "eval_runtime": 85.9425,
+ "eval_samples_per_second": 15.999,
+ "eval_steps_per_second": 2.001,
+ "step": 2540
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.5037830618380902e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2560/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2560/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2560/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2560/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2560/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2560/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2560/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2560/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2560/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2560/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2560/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2560/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2560/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2560/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..4854cf4f0d7b2858e43ee9d5d07eff07234a453c
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2560/trainer_state.json
@@ -0,0 +1,2722 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 6.3686176836861765,
+ "eval_steps": 20,
+ "global_step": 2560,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ },
+ {
+ "entropy": 0.3193941755220294,
+ "epoch": 4.5280199252802,
+ "grad_norm": 0.8281906843185425,
+ "learning_rate": 0.0001509111761786888,
+ "loss": 0.23936262130737304,
+ "mean_token_accuracy": 0.9201708927750587,
+ "num_tokens": 4244423.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.5280199252802,
+ "eval_entropy": 0.38704028864239537,
+ "eval_loss": 0.6006569266319275,
+ "eval_mean_token_accuracy": 0.8502406720505205,
+ "eval_num_tokens": 4244423.0,
+ "eval_runtime": 86.8059,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1820
+ },
+ {
+ "entropy": 0.3164879363030195,
+ "epoch": 4.577833125778331,
+ "grad_norm": 0.7892968654632568,
+ "learning_rate": 0.00014905346557909867,
+ "loss": 0.24541733264923096,
+ "mean_token_accuracy": 0.9175932116806507,
+ "num_tokens": 4289773.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.577833125778331,
+ "eval_entropy": 0.38861122120951497,
+ "eval_loss": 0.6115967631340027,
+ "eval_mean_token_accuracy": 0.849471275196519,
+ "eval_num_tokens": 4289773.0,
+ "eval_runtime": 86.2946,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1840
+ },
+ {
+ "entropy": 0.3051785985007882,
+ "epoch": 4.627646326276463,
+ "grad_norm": 0.8109654188156128,
+ "learning_rate": 0.0001471849238862319,
+ "loss": 0.23433220386505127,
+ "mean_token_accuracy": 0.9206570319831371,
+ "num_tokens": 4336894.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.627646326276463,
+ "eval_entropy": 0.37162452295076015,
+ "eval_loss": 0.6184061765670776,
+ "eval_mean_token_accuracy": 0.8501173268223918,
+ "eval_num_tokens": 4336894.0,
+ "eval_runtime": 86.6865,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1860
+ },
+ {
+ "entropy": 0.3168198253959417,
+ "epoch": 4.677459526774595,
+ "grad_norm": 0.9512342214584351,
+ "learning_rate": 0.0001453061146267775,
+ "loss": 0.23832404613494873,
+ "mean_token_accuracy": 0.9197044663131237,
+ "num_tokens": 4382947.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.677459526774595,
+ "eval_entropy": 0.3845940856912801,
+ "eval_loss": 0.606762707233429,
+ "eval_mean_token_accuracy": 0.8504838194957999,
+ "eval_num_tokens": 4382947.0,
+ "eval_runtime": 86.5175,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 1880
+ },
+ {
+ "entropy": 0.30791807882487776,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 0.8123113512992859,
+ "learning_rate": 0.00014341760442398248,
+ "loss": 0.2395785331726074,
+ "mean_token_accuracy": 0.918928150832653,
+ "num_tokens": 4433050.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.7272727272727275,
+ "eval_entropy": 0.39762327222283494,
+ "eval_loss": 0.5994202494621277,
+ "eval_mean_token_accuracy": 0.8509274201337681,
+ "eval_num_tokens": 4433050.0,
+ "eval_runtime": 86.2873,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.993,
+ "step": 1900
+ },
+ {
+ "entropy": 0.3021434534341097,
+ "epoch": 4.777085927770859,
+ "grad_norm": 0.731787383556366,
+ "learning_rate": 0.000141519962826766,
+ "loss": 0.23494718074798585,
+ "mean_token_accuracy": 0.9201403826475143,
+ "num_tokens": 4483598.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.777085927770859,
+ "eval_entropy": 0.3827026732439219,
+ "eval_loss": 0.5995895862579346,
+ "eval_mean_token_accuracy": 0.851468373523202,
+ "eval_num_tokens": 4483598.0,
+ "eval_runtime": 86.3006,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 1920
+ },
+ {
+ "entropy": 0.31626159623265265,
+ "epoch": 4.826899128268991,
+ "grad_norm": 0.8848487138748169,
+ "learning_rate": 0.00013961376213795132,
+ "loss": 0.2439030647277832,
+ "mean_token_accuracy": 0.9196575872600079,
+ "num_tokens": 4529201.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.826899128268991,
+ "eval_entropy": 0.388698436839636,
+ "eval_loss": 0.6000174283981323,
+ "eval_mean_token_accuracy": 0.8518068187458571,
+ "eval_num_tokens": 4529201.0,
+ "eval_runtime": 86.8979,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.979,
+ "step": 1940
+ },
+ {
+ "entropy": 0.30520407035946845,
+ "epoch": 4.876712328767123,
+ "grad_norm": 0.8532460927963257,
+ "learning_rate": 0.00013769957724166695,
+ "loss": 0.23458616733551024,
+ "mean_token_accuracy": 0.9221912942826748,
+ "num_tokens": 4578167.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.876712328767123,
+ "eval_entropy": 0.38777847102908203,
+ "eval_loss": 0.6004981398582458,
+ "eval_mean_token_accuracy": 0.8516481768253238,
+ "eval_num_tokens": 4578167.0,
+ "eval_runtime": 87.0777,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.975,
+ "step": 1960
+ },
+ {
+ "entropy": 0.3226448342204094,
+ "epoch": 4.926525529265255,
+ "grad_norm": 0.6945561766624451,
+ "learning_rate": 0.0001357779854299694,
+ "loss": 0.24048397541046143,
+ "mean_token_accuracy": 0.9195300146937371,
+ "num_tokens": 4622316.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.926525529265255,
+ "eval_entropy": 0.38581624263247777,
+ "eval_loss": 0.6029234528541565,
+ "eval_mean_token_accuracy": 0.8514213260523108,
+ "eval_num_tokens": 4622316.0,
+ "eval_runtime": 85.8729,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 1980
+ },
+ {
+ "entropy": 0.3051655298098922,
+ "epoch": 4.976338729763388,
+ "grad_norm": 0.7976452708244324,
+ "learning_rate": 0.00013384956622874001,
+ "loss": 0.23584742546081544,
+ "mean_token_accuracy": 0.9216851457953453,
+ "num_tokens": 4670746.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.976338729763388,
+ "eval_entropy": 0.37913159246361533,
+ "eval_loss": 0.6057604551315308,
+ "eval_mean_token_accuracy": 0.8525801203971686,
+ "eval_num_tokens": 4670746.0,
+ "eval_runtime": 86.1145,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2000
+ },
+ {
+ "entropy": 0.27438195240803254,
+ "epoch": 5.024906600249066,
+ "grad_norm": 0.6729586124420166,
+ "learning_rate": 0.0001319149012229075,
+ "loss": 0.19775952100753785,
+ "mean_token_accuracy": 0.9339428559327737,
+ "num_tokens": 4716176.0,
+ "step": 2020
+ },
+ {
+ "epoch": 5.024906600249066,
+ "eval_entropy": 0.3448961910813354,
+ "eval_loss": 0.6750120520591736,
+ "eval_mean_token_accuracy": 0.8487970232963562,
+ "eval_num_tokens": 4716176.0,
+ "eval_runtime": 86.1169,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2020
+ },
+ {
+ "entropy": 0.21423916313797237,
+ "epoch": 5.074719800747198,
+ "grad_norm": 0.6934391856193542,
+ "learning_rate": 0.00012997457388105022,
+ "loss": 0.1439570426940918,
+ "mean_token_accuracy": 0.9528236843645572,
+ "num_tokens": 4763269.0,
+ "step": 2040
+ },
+ {
+ "epoch": 5.074719800747198,
+ "eval_entropy": 0.3570949243771475,
+ "eval_loss": 0.6465504169464111,
+ "eval_mean_token_accuracy": 0.8490785547467166,
+ "eval_num_tokens": 4763269.0,
+ "eval_runtime": 85.9574,
+ "eval_samples_per_second": 15.996,
+ "eval_steps_per_second": 2.001,
+ "step": 2040
+ },
+ {
+ "entropy": 0.20838565267622472,
+ "epoch": 5.12453300124533,
+ "grad_norm": 0.7286986112594604,
+ "learning_rate": 0.00012802916937942972,
+ "loss": 0.14467307329177856,
+ "mean_token_accuracy": 0.950994835793972,
+ "num_tokens": 4809047.0,
+ "step": 2060
+ },
+ {
+ "epoch": 5.12453300124533,
+ "eval_entropy": 0.3452463157821533,
+ "eval_loss": 0.6705958843231201,
+ "eval_mean_token_accuracy": 0.8490352796953778,
+ "eval_num_tokens": 4809047.0,
+ "eval_runtime": 86.228,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 2060
+ },
+ {
+ "entropy": 0.20453082229942082,
+ "epoch": 5.174346201743462,
+ "grad_norm": 0.7515555620193481,
+ "learning_rate": 0.00012607927442550974,
+ "loss": 0.13732000589370727,
+ "mean_token_accuracy": 0.9537357829511166,
+ "num_tokens": 4857965.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.174346201743462,
+ "eval_entropy": 0.32431264914745506,
+ "eval_loss": 0.6743043065071106,
+ "eval_mean_token_accuracy": 0.8504878629085629,
+ "eval_num_tokens": 4857965.0,
+ "eval_runtime": 86.5948,
+ "eval_samples_per_second": 15.879,
+ "eval_steps_per_second": 1.986,
+ "step": 2080
+ },
+ {
+ "entropy": 0.21812320686876774,
+ "epoch": 5.224159402241594,
+ "grad_norm": 0.9093465209007263,
+ "learning_rate": 0.0001241254770810132,
+ "loss": 0.14311420917510986,
+ "mean_token_accuracy": 0.9514068141579628,
+ "num_tokens": 4905151.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.224159402241594,
+ "eval_entropy": 0.33086285835435225,
+ "eval_loss": 0.6676449179649353,
+ "eval_mean_token_accuracy": 0.8505287662495015,
+ "eval_num_tokens": 4905151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 2100
+ },
+ {
+ "entropy": 0.2180163251236081,
+ "epoch": 5.273972602739726,
+ "grad_norm": 0.6703007221221924,
+ "learning_rate": 0.00012216836658457075,
+ "loss": 0.14803968667984008,
+ "mean_token_accuracy": 0.9521303348243236,
+ "num_tokens": 4947072.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.273972602739726,
+ "eval_entropy": 0.33162341708707255,
+ "eval_loss": 0.6658875942230225,
+ "eval_mean_token_accuracy": 0.8500757605530495,
+ "eval_num_tokens": 4947072.0,
+ "eval_runtime": 86.6296,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 2120
+ },
+ {
+ "entropy": 0.22511130161583423,
+ "epoch": 5.323785803237858,
+ "grad_norm": 0.8078880906105042,
+ "learning_rate": 0.00012020853317401455,
+ "loss": 0.15228408575057983,
+ "mean_token_accuracy": 0.947144789993763,
+ "num_tokens": 4991974.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.323785803237858,
+ "eval_entropy": 0.3354601170434508,
+ "eval_loss": 0.6677829623222351,
+ "eval_mean_token_accuracy": 0.8482600024273229,
+ "eval_num_tokens": 4991974.0,
+ "eval_runtime": 86.4689,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.989,
+ "step": 2140
+ },
+ {
+ "entropy": 0.2244176059961319,
+ "epoch": 5.37359900373599,
+ "grad_norm": 0.9636075496673584,
+ "learning_rate": 0.00011824656790837037,
+ "loss": 0.15260883569717407,
+ "mean_token_accuracy": 0.9471467643976211,
+ "num_tokens": 5038400.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.37359900373599,
+ "eval_entropy": 0.3381616926297199,
+ "eval_loss": 0.6694412231445312,
+ "eval_mean_token_accuracy": 0.8482369603805764,
+ "eval_num_tokens": 5038400.0,
+ "eval_runtime": 86.4147,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 2160
+ },
+ {
+ "entropy": 0.22982364390045404,
+ "epoch": 5.423412204234122,
+ "grad_norm": 0.775401771068573,
+ "learning_rate": 0.00011628306248960262,
+ "loss": 0.15140302181243898,
+ "mean_token_accuracy": 0.9492553934454918,
+ "num_tokens": 5083166.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.423412204234122,
+ "eval_entropy": 0.3305150235808173,
+ "eval_loss": 0.6717822551727295,
+ "eval_mean_token_accuracy": 0.8489849723355715,
+ "eval_num_tokens": 5083166.0,
+ "eval_runtime": 86.4728,
+ "eval_samples_per_second": 15.901,
+ "eval_steps_per_second": 1.989,
+ "step": 2180
+ },
+ {
+ "entropy": 0.21448935717344284,
+ "epoch": 5.473225404732254,
+ "grad_norm": 0.6575281023979187,
+ "learning_rate": 0.00011431860908416465,
+ "loss": 0.1452319622039795,
+ "mean_token_accuracy": 0.9505287684500218,
+ "num_tokens": 5135109.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.473225404732254,
+ "eval_entropy": 0.3488145174328671,
+ "eval_loss": 0.6612305641174316,
+ "eval_mean_token_accuracy": 0.8492907808963642,
+ "eval_num_tokens": 5135109.0,
+ "eval_runtime": 86.6927,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 2200
+ },
+ {
+ "entropy": 0.23091202937066554,
+ "epoch": 5.523038605230386,
+ "grad_norm": 0.8909686207771301,
+ "learning_rate": 0.00011235380014440985,
+ "loss": 0.15150139331817628,
+ "mean_token_accuracy": 0.9497875183820724,
+ "num_tokens": 5180138.0,
+ "step": 2220
+ },
+ {
+ "epoch": 5.523038605230386,
+ "eval_entropy": 0.3268539015810157,
+ "eval_loss": 0.6667542457580566,
+ "eval_mean_token_accuracy": 0.8499062903398691,
+ "eval_num_tokens": 5180138.0,
+ "eval_runtime": 86.4644,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 2220
+ },
+ {
+ "entropy": 0.2227974807843566,
+ "epoch": 5.572851805728518,
+ "grad_norm": 0.6180275082588196,
+ "learning_rate": 0.0001103892282299158,
+ "loss": 0.1491069197654724,
+ "mean_token_accuracy": 0.9488144010305405,
+ "num_tokens": 5226864.0,
+ "step": 2240
+ },
+ {
+ "epoch": 5.572851805728518,
+ "eval_entropy": 0.3346347655494546,
+ "eval_loss": 0.6665948629379272,
+ "eval_mean_token_accuracy": 0.8499961893918903,
+ "eval_num_tokens": 5226864.0,
+ "eval_runtime": 87.0548,
+ "eval_samples_per_second": 15.795,
+ "eval_steps_per_second": 1.976,
+ "step": 2240
+ },
+ {
+ "entropy": 0.21368421968072654,
+ "epoch": 5.62266500622665,
+ "grad_norm": 0.6004369258880615,
+ "learning_rate": 0.00010842548582877651,
+ "loss": 0.14485255479812623,
+ "mean_token_accuracy": 0.9502056457102299,
+ "num_tokens": 5276602.0,
+ "step": 2260
+ },
+ {
+ "epoch": 5.62266500622665,
+ "eval_entropy": 0.32753298804163933,
+ "eval_loss": 0.6680151224136353,
+ "eval_mean_token_accuracy": 0.8515451086121936,
+ "eval_num_tokens": 5276602.0,
+ "eval_runtime": 86.8524,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.98,
+ "step": 2260
+ },
+ {
+ "entropy": 0.2103635374456644,
+ "epoch": 5.672478206724782,
+ "grad_norm": 0.699174702167511,
+ "learning_rate": 0.00010646316517891613,
+ "loss": 0.14297772645950318,
+ "mean_token_accuracy": 0.9512537539005279,
+ "num_tokens": 5323718.0,
+ "step": 2280
+ },
+ {
+ "epoch": 5.672478206724782,
+ "eval_entropy": 0.32966585959806,
+ "eval_loss": 0.675578773021698,
+ "eval_mean_token_accuracy": 0.8509623023659684,
+ "eval_num_tokens": 5323718.0,
+ "eval_runtime": 86.4518,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2280
+ },
+ {
+ "entropy": 0.22516900151968003,
+ "epoch": 5.722291407222914,
+ "grad_norm": 0.6637354493141174,
+ "learning_rate": 0.00010450285808947797,
+ "loss": 0.15202572345733642,
+ "mean_token_accuracy": 0.9482452072203159,
+ "num_tokens": 5369039.0,
+ "step": 2300
+ },
+ {
+ "epoch": 5.722291407222914,
+ "eval_entropy": 0.3369456917740578,
+ "eval_loss": 0.6697061061859131,
+ "eval_mean_token_accuracy": 0.848603522361711,
+ "eval_num_tokens": 5369039.0,
+ "eval_runtime": 86.6371,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.985,
+ "step": 2300
+ },
+ {
+ "entropy": 0.21841065725311637,
+ "epoch": 5.772104607721046,
+ "grad_norm": 0.7940268516540527,
+ "learning_rate": 0.00010254515576234297,
+ "loss": 0.14710167646408082,
+ "mean_token_accuracy": 0.9493498183786869,
+ "num_tokens": 5417029.0,
+ "step": 2320
+ },
+ {
+ "epoch": 5.772104607721046,
+ "eval_entropy": 0.3237486180177955,
+ "eval_loss": 0.6779657602310181,
+ "eval_mean_token_accuracy": 0.8500715313955794,
+ "eval_num_tokens": 5417029.0,
+ "eval_runtime": 86.1826,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 1.996,
+ "step": 2320
+ },
+ {
+ "entropy": 0.22146204356104135,
+ "epoch": 5.821917808219178,
+ "grad_norm": 0.9234833121299744,
+ "learning_rate": 0.00010059064861383132,
+ "loss": 0.14720046520233154,
+ "mean_token_accuracy": 0.9493872679769992,
+ "num_tokens": 5461671.0,
+ "step": 2340
+ },
+ {
+ "epoch": 5.821917808219178,
+ "eval_entropy": 0.32365207564692167,
+ "eval_loss": 0.6704005002975464,
+ "eval_mean_token_accuracy": 0.8507985760306203,
+ "eval_num_tokens": 5461671.0,
+ "eval_runtime": 86.5494,
+ "eval_samples_per_second": 15.887,
+ "eval_steps_per_second": 1.987,
+ "step": 2340
+ },
+ {
+ "entropy": 0.20934011954814197,
+ "epoch": 5.87173100871731,
+ "grad_norm": 0.5547503232955933,
+ "learning_rate": 9.863992609664084e-05,
+ "loss": 0.1464867353439331,
+ "mean_token_accuracy": 0.9503875687718392,
+ "num_tokens": 5509312.0,
+ "step": 2360
+ },
+ {
+ "epoch": 5.87173100871731,
+ "eval_entropy": 0.3330401429083458,
+ "eval_loss": 0.6659091114997864,
+ "eval_mean_token_accuracy": 0.8504848906467127,
+ "eval_num_tokens": 5509312.0,
+ "eval_runtime": 86.5855,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 2360
+ },
+ {
+ "entropy": 0.21678635366261007,
+ "epoch": 5.921544209215442,
+ "grad_norm": 0.570612907409668,
+ "learning_rate": 9.669357652207635e-05,
+ "loss": 0.14821385145187377,
+ "mean_token_accuracy": 0.9503940217196941,
+ "num_tokens": 5558196.0,
+ "step": 2380
+ },
+ {
+ "epoch": 5.921544209215442,
+ "eval_entropy": 0.3322022325077722,
+ "eval_loss": 0.6722489595413208,
+ "eval_mean_token_accuracy": 0.8489979422369669,
+ "eval_num_tokens": 5558196.0,
+ "eval_runtime": 86.2986,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 2380
+ },
+ {
+ "entropy": 0.20932920072227718,
+ "epoch": 5.971357409713574,
+ "grad_norm": 0.7879557609558105,
+ "learning_rate": 9.475218688262262e-05,
+ "loss": 0.14675841331481934,
+ "mean_token_accuracy": 0.9507176131010056,
+ "num_tokens": 5605400.0,
+ "step": 2400
+ },
+ {
+ "epoch": 5.971357409713574,
+ "eval_entropy": 0.3199348642902319,
+ "eval_loss": 0.6698136329650879,
+ "eval_mean_token_accuracy": 0.8514142130003419,
+ "eval_num_tokens": 5605400.0,
+ "eval_runtime": 85.8995,
+ "eval_samples_per_second": 16.007,
+ "eval_steps_per_second": 2.002,
+ "step": 2400
+ },
+ {
+ "entropy": 0.21032143919131693,
+ "epoch": 6.019925280199253,
+ "grad_norm": 0.5823076367378235,
+ "learning_rate": 9.281634267491569e-05,
+ "loss": 0.13322267532348633,
+ "mean_token_accuracy": 0.9550939072401096,
+ "num_tokens": 5648968.0,
+ "step": 2420
+ },
+ {
+ "epoch": 6.019925280199253,
+ "eval_entropy": 0.30206270117399303,
+ "eval_loss": 0.7093168497085571,
+ "eval_mean_token_accuracy": 0.8500627639681794,
+ "eval_num_tokens": 5648968.0,
+ "eval_runtime": 85.8128,
+ "eval_samples_per_second": 16.023,
+ "eval_steps_per_second": 2.004,
+ "step": 2420
+ },
+ {
+ "entropy": 0.1534628233872354,
+ "epoch": 6.069738480697385,
+ "grad_norm": 0.710133969783783,
+ "learning_rate": 9.088662772316508e-05,
+ "loss": 0.09078952670097351,
+ "mean_token_accuracy": 0.9678447999060154,
+ "num_tokens": 5697633.0,
+ "step": 2440
+ },
+ {
+ "epoch": 6.069738480697385,
+ "eval_entropy": 0.28208133101809857,
+ "eval_loss": 0.7636417150497437,
+ "eval_mean_token_accuracy": 0.8494061477655588,
+ "eval_num_tokens": 5697633.0,
+ "eval_runtime": 85.9724,
+ "eval_samples_per_second": 15.994,
+ "eval_steps_per_second": 2.001,
+ "step": 2440
+ },
+ {
+ "entropy": 0.16151462448760867,
+ "epoch": 6.119551681195516,
+ "grad_norm": 0.5793812274932861,
+ "learning_rate": 8.896362400308028e-05,
+ "loss": 0.09545697569847107,
+ "mean_token_accuracy": 0.9671573750674725,
+ "num_tokens": 5745090.0,
+ "step": 2460
+ },
+ {
+ "epoch": 6.119551681195516,
+ "eval_entropy": 0.2833245605403601,
+ "eval_loss": 0.7402405738830566,
+ "eval_mean_token_accuracy": 0.8503523728875226,
+ "eval_num_tokens": 5745090.0,
+ "eval_runtime": 85.5461,
+ "eval_samples_per_second": 16.073,
+ "eval_steps_per_second": 2.011,
+ "step": 2460
+ },
+ {
+ "entropy": 0.15203177919611335,
+ "epoch": 6.169364881693649,
+ "grad_norm": 0.4251123368740082,
+ "learning_rate": 8.704791146635483e-05,
+ "loss": 0.09420782327651978,
+ "mean_token_accuracy": 0.9677386932075024,
+ "num_tokens": 5790333.0,
+ "step": 2480
+ },
+ {
+ "epoch": 6.169364881693649,
+ "eval_entropy": 0.28572545962971313,
+ "eval_loss": 0.735416829586029,
+ "eval_mean_token_accuracy": 0.8487084663884584,
+ "eval_num_tokens": 5790333.0,
+ "eval_runtime": 85.4801,
+ "eval_samples_per_second": 16.086,
+ "eval_steps_per_second": 2.012,
+ "step": 2480
+ },
+ {
+ "entropy": 0.15587336672469973,
+ "epoch": 6.219178082191781,
+ "grad_norm": 0.4357028007507324,
+ "learning_rate": 8.514006786576085e-05,
+ "loss": 0.09429320096969604,
+ "mean_token_accuracy": 0.9682952925562859,
+ "num_tokens": 5837321.0,
+ "step": 2500
+ },
+ {
+ "epoch": 6.219178082191781,
+ "eval_entropy": 0.2859006894882335,
+ "eval_loss": 0.7347224950790405,
+ "eval_mean_token_accuracy": 0.8501905518215757,
+ "eval_num_tokens": 5837321.0,
+ "eval_runtime": 85.7578,
+ "eval_samples_per_second": 16.034,
+ "eval_steps_per_second": 2.006,
+ "step": 2500
+ },
+ {
+ "entropy": 0.15765639198943973,
+ "epoch": 6.268991282689913,
+ "grad_norm": 0.47331130504608154,
+ "learning_rate": 8.324066858090663e-05,
+ "loss": 0.09571113586425781,
+ "mean_token_accuracy": 0.9683481335639954,
+ "num_tokens": 5884398.0,
+ "step": 2520
+ },
+ {
+ "epoch": 6.268991282689913,
+ "eval_entropy": 0.29231513846059176,
+ "eval_loss": 0.7392512559890747,
+ "eval_mean_token_accuracy": 0.8486633983462356,
+ "eval_num_tokens": 5884398.0,
+ "eval_runtime": 85.7846,
+ "eval_samples_per_second": 16.029,
+ "eval_steps_per_second": 2.005,
+ "step": 2520
+ },
+ {
+ "entropy": 0.16176860257983208,
+ "epoch": 6.318804483188045,
+ "grad_norm": 0.6142018437385559,
+ "learning_rate": 8.135028644470992e-05,
+ "loss": 0.09486144185066223,
+ "mean_token_accuracy": 0.9682316601276397,
+ "num_tokens": 5929876.0,
+ "step": 2540
+ },
+ {
+ "epoch": 6.318804483188045,
+ "eval_entropy": 0.2851274753379267,
+ "eval_loss": 0.7520816922187805,
+ "eval_mean_token_accuracy": 0.8501113649717597,
+ "eval_num_tokens": 5929876.0,
+ "eval_runtime": 85.9425,
+ "eval_samples_per_second": 15.999,
+ "eval_steps_per_second": 2.001,
+ "step": 2540
+ },
+ {
+ "entropy": 0.15404034564271568,
+ "epoch": 6.3686176836861765,
+ "grad_norm": 0.6051287651062012,
+ "learning_rate": 7.946949157063964e-05,
+ "loss": 0.09280472993850708,
+ "mean_token_accuracy": 0.9684635892510414,
+ "num_tokens": 5978490.0,
+ "step": 2560
+ },
+ {
+ "epoch": 6.3686176836861765,
+ "eval_entropy": 0.28802703563557114,
+ "eval_loss": 0.7439162135124207,
+ "eval_mean_token_accuracy": 0.8499851770872293,
+ "eval_num_tokens": 5978490.0,
+ "eval_runtime": 86.0703,
+ "eval_samples_per_second": 15.975,
+ "eval_steps_per_second": 1.998,
+ "step": 2560
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.5240683955550822e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2580/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2580/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2580/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2580/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2580/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2580/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2580/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2580/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2580/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2580/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2580/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2580/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2580/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2580/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..6ff20979d13827c4afbe255963900b9c409536ea
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2580/trainer_state.json
@@ -0,0 +1,2743 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 6.418430884184309,
+ "eval_steps": 20,
+ "global_step": 2580,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ },
+ {
+ "entropy": 0.3193941755220294,
+ "epoch": 4.5280199252802,
+ "grad_norm": 0.8281906843185425,
+ "learning_rate": 0.0001509111761786888,
+ "loss": 0.23936262130737304,
+ "mean_token_accuracy": 0.9201708927750587,
+ "num_tokens": 4244423.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.5280199252802,
+ "eval_entropy": 0.38704028864239537,
+ "eval_loss": 0.6006569266319275,
+ "eval_mean_token_accuracy": 0.8502406720505205,
+ "eval_num_tokens": 4244423.0,
+ "eval_runtime": 86.8059,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1820
+ },
+ {
+ "entropy": 0.3164879363030195,
+ "epoch": 4.577833125778331,
+ "grad_norm": 0.7892968654632568,
+ "learning_rate": 0.00014905346557909867,
+ "loss": 0.24541733264923096,
+ "mean_token_accuracy": 0.9175932116806507,
+ "num_tokens": 4289773.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.577833125778331,
+ "eval_entropy": 0.38861122120951497,
+ "eval_loss": 0.6115967631340027,
+ "eval_mean_token_accuracy": 0.849471275196519,
+ "eval_num_tokens": 4289773.0,
+ "eval_runtime": 86.2946,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1840
+ },
+ {
+ "entropy": 0.3051785985007882,
+ "epoch": 4.627646326276463,
+ "grad_norm": 0.8109654188156128,
+ "learning_rate": 0.0001471849238862319,
+ "loss": 0.23433220386505127,
+ "mean_token_accuracy": 0.9206570319831371,
+ "num_tokens": 4336894.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.627646326276463,
+ "eval_entropy": 0.37162452295076015,
+ "eval_loss": 0.6184061765670776,
+ "eval_mean_token_accuracy": 0.8501173268223918,
+ "eval_num_tokens": 4336894.0,
+ "eval_runtime": 86.6865,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1860
+ },
+ {
+ "entropy": 0.3168198253959417,
+ "epoch": 4.677459526774595,
+ "grad_norm": 0.9512342214584351,
+ "learning_rate": 0.0001453061146267775,
+ "loss": 0.23832404613494873,
+ "mean_token_accuracy": 0.9197044663131237,
+ "num_tokens": 4382947.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.677459526774595,
+ "eval_entropy": 0.3845940856912801,
+ "eval_loss": 0.606762707233429,
+ "eval_mean_token_accuracy": 0.8504838194957999,
+ "eval_num_tokens": 4382947.0,
+ "eval_runtime": 86.5175,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 1880
+ },
+ {
+ "entropy": 0.30791807882487776,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 0.8123113512992859,
+ "learning_rate": 0.00014341760442398248,
+ "loss": 0.2395785331726074,
+ "mean_token_accuracy": 0.918928150832653,
+ "num_tokens": 4433050.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.7272727272727275,
+ "eval_entropy": 0.39762327222283494,
+ "eval_loss": 0.5994202494621277,
+ "eval_mean_token_accuracy": 0.8509274201337681,
+ "eval_num_tokens": 4433050.0,
+ "eval_runtime": 86.2873,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.993,
+ "step": 1900
+ },
+ {
+ "entropy": 0.3021434534341097,
+ "epoch": 4.777085927770859,
+ "grad_norm": 0.731787383556366,
+ "learning_rate": 0.000141519962826766,
+ "loss": 0.23494718074798585,
+ "mean_token_accuracy": 0.9201403826475143,
+ "num_tokens": 4483598.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.777085927770859,
+ "eval_entropy": 0.3827026732439219,
+ "eval_loss": 0.5995895862579346,
+ "eval_mean_token_accuracy": 0.851468373523202,
+ "eval_num_tokens": 4483598.0,
+ "eval_runtime": 86.3006,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 1920
+ },
+ {
+ "entropy": 0.31626159623265265,
+ "epoch": 4.826899128268991,
+ "grad_norm": 0.8848487138748169,
+ "learning_rate": 0.00013961376213795132,
+ "loss": 0.2439030647277832,
+ "mean_token_accuracy": 0.9196575872600079,
+ "num_tokens": 4529201.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.826899128268991,
+ "eval_entropy": 0.388698436839636,
+ "eval_loss": 0.6000174283981323,
+ "eval_mean_token_accuracy": 0.8518068187458571,
+ "eval_num_tokens": 4529201.0,
+ "eval_runtime": 86.8979,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.979,
+ "step": 1940
+ },
+ {
+ "entropy": 0.30520407035946845,
+ "epoch": 4.876712328767123,
+ "grad_norm": 0.8532460927963257,
+ "learning_rate": 0.00013769957724166695,
+ "loss": 0.23458616733551024,
+ "mean_token_accuracy": 0.9221912942826748,
+ "num_tokens": 4578167.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.876712328767123,
+ "eval_entropy": 0.38777847102908203,
+ "eval_loss": 0.6004981398582458,
+ "eval_mean_token_accuracy": 0.8516481768253238,
+ "eval_num_tokens": 4578167.0,
+ "eval_runtime": 87.0777,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.975,
+ "step": 1960
+ },
+ {
+ "entropy": 0.3226448342204094,
+ "epoch": 4.926525529265255,
+ "grad_norm": 0.6945561766624451,
+ "learning_rate": 0.0001357779854299694,
+ "loss": 0.24048397541046143,
+ "mean_token_accuracy": 0.9195300146937371,
+ "num_tokens": 4622316.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.926525529265255,
+ "eval_entropy": 0.38581624263247777,
+ "eval_loss": 0.6029234528541565,
+ "eval_mean_token_accuracy": 0.8514213260523108,
+ "eval_num_tokens": 4622316.0,
+ "eval_runtime": 85.8729,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 1980
+ },
+ {
+ "entropy": 0.3051655298098922,
+ "epoch": 4.976338729763388,
+ "grad_norm": 0.7976452708244324,
+ "learning_rate": 0.00013384956622874001,
+ "loss": 0.23584742546081544,
+ "mean_token_accuracy": 0.9216851457953453,
+ "num_tokens": 4670746.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.976338729763388,
+ "eval_entropy": 0.37913159246361533,
+ "eval_loss": 0.6057604551315308,
+ "eval_mean_token_accuracy": 0.8525801203971686,
+ "eval_num_tokens": 4670746.0,
+ "eval_runtime": 86.1145,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2000
+ },
+ {
+ "entropy": 0.27438195240803254,
+ "epoch": 5.024906600249066,
+ "grad_norm": 0.6729586124420166,
+ "learning_rate": 0.0001319149012229075,
+ "loss": 0.19775952100753785,
+ "mean_token_accuracy": 0.9339428559327737,
+ "num_tokens": 4716176.0,
+ "step": 2020
+ },
+ {
+ "epoch": 5.024906600249066,
+ "eval_entropy": 0.3448961910813354,
+ "eval_loss": 0.6750120520591736,
+ "eval_mean_token_accuracy": 0.8487970232963562,
+ "eval_num_tokens": 4716176.0,
+ "eval_runtime": 86.1169,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2020
+ },
+ {
+ "entropy": 0.21423916313797237,
+ "epoch": 5.074719800747198,
+ "grad_norm": 0.6934391856193542,
+ "learning_rate": 0.00012997457388105022,
+ "loss": 0.1439570426940918,
+ "mean_token_accuracy": 0.9528236843645572,
+ "num_tokens": 4763269.0,
+ "step": 2040
+ },
+ {
+ "epoch": 5.074719800747198,
+ "eval_entropy": 0.3570949243771475,
+ "eval_loss": 0.6465504169464111,
+ "eval_mean_token_accuracy": 0.8490785547467166,
+ "eval_num_tokens": 4763269.0,
+ "eval_runtime": 85.9574,
+ "eval_samples_per_second": 15.996,
+ "eval_steps_per_second": 2.001,
+ "step": 2040
+ },
+ {
+ "entropy": 0.20838565267622472,
+ "epoch": 5.12453300124533,
+ "grad_norm": 0.7286986112594604,
+ "learning_rate": 0.00012802916937942972,
+ "loss": 0.14467307329177856,
+ "mean_token_accuracy": 0.950994835793972,
+ "num_tokens": 4809047.0,
+ "step": 2060
+ },
+ {
+ "epoch": 5.12453300124533,
+ "eval_entropy": 0.3452463157821533,
+ "eval_loss": 0.6705958843231201,
+ "eval_mean_token_accuracy": 0.8490352796953778,
+ "eval_num_tokens": 4809047.0,
+ "eval_runtime": 86.228,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 2060
+ },
+ {
+ "entropy": 0.20453082229942082,
+ "epoch": 5.174346201743462,
+ "grad_norm": 0.7515555620193481,
+ "learning_rate": 0.00012607927442550974,
+ "loss": 0.13732000589370727,
+ "mean_token_accuracy": 0.9537357829511166,
+ "num_tokens": 4857965.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.174346201743462,
+ "eval_entropy": 0.32431264914745506,
+ "eval_loss": 0.6743043065071106,
+ "eval_mean_token_accuracy": 0.8504878629085629,
+ "eval_num_tokens": 4857965.0,
+ "eval_runtime": 86.5948,
+ "eval_samples_per_second": 15.879,
+ "eval_steps_per_second": 1.986,
+ "step": 2080
+ },
+ {
+ "entropy": 0.21812320686876774,
+ "epoch": 5.224159402241594,
+ "grad_norm": 0.9093465209007263,
+ "learning_rate": 0.0001241254770810132,
+ "loss": 0.14311420917510986,
+ "mean_token_accuracy": 0.9514068141579628,
+ "num_tokens": 4905151.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.224159402241594,
+ "eval_entropy": 0.33086285835435225,
+ "eval_loss": 0.6676449179649353,
+ "eval_mean_token_accuracy": 0.8505287662495015,
+ "eval_num_tokens": 4905151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 2100
+ },
+ {
+ "entropy": 0.2180163251236081,
+ "epoch": 5.273972602739726,
+ "grad_norm": 0.6703007221221924,
+ "learning_rate": 0.00012216836658457075,
+ "loss": 0.14803968667984008,
+ "mean_token_accuracy": 0.9521303348243236,
+ "num_tokens": 4947072.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.273972602739726,
+ "eval_entropy": 0.33162341708707255,
+ "eval_loss": 0.6658875942230225,
+ "eval_mean_token_accuracy": 0.8500757605530495,
+ "eval_num_tokens": 4947072.0,
+ "eval_runtime": 86.6296,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 2120
+ },
+ {
+ "entropy": 0.22511130161583423,
+ "epoch": 5.323785803237858,
+ "grad_norm": 0.8078880906105042,
+ "learning_rate": 0.00012020853317401455,
+ "loss": 0.15228408575057983,
+ "mean_token_accuracy": 0.947144789993763,
+ "num_tokens": 4991974.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.323785803237858,
+ "eval_entropy": 0.3354601170434508,
+ "eval_loss": 0.6677829623222351,
+ "eval_mean_token_accuracy": 0.8482600024273229,
+ "eval_num_tokens": 4991974.0,
+ "eval_runtime": 86.4689,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.989,
+ "step": 2140
+ },
+ {
+ "entropy": 0.2244176059961319,
+ "epoch": 5.37359900373599,
+ "grad_norm": 0.9636075496673584,
+ "learning_rate": 0.00011824656790837037,
+ "loss": 0.15260883569717407,
+ "mean_token_accuracy": 0.9471467643976211,
+ "num_tokens": 5038400.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.37359900373599,
+ "eval_entropy": 0.3381616926297199,
+ "eval_loss": 0.6694412231445312,
+ "eval_mean_token_accuracy": 0.8482369603805764,
+ "eval_num_tokens": 5038400.0,
+ "eval_runtime": 86.4147,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 2160
+ },
+ {
+ "entropy": 0.22982364390045404,
+ "epoch": 5.423412204234122,
+ "grad_norm": 0.775401771068573,
+ "learning_rate": 0.00011628306248960262,
+ "loss": 0.15140302181243898,
+ "mean_token_accuracy": 0.9492553934454918,
+ "num_tokens": 5083166.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.423412204234122,
+ "eval_entropy": 0.3305150235808173,
+ "eval_loss": 0.6717822551727295,
+ "eval_mean_token_accuracy": 0.8489849723355715,
+ "eval_num_tokens": 5083166.0,
+ "eval_runtime": 86.4728,
+ "eval_samples_per_second": 15.901,
+ "eval_steps_per_second": 1.989,
+ "step": 2180
+ },
+ {
+ "entropy": 0.21448935717344284,
+ "epoch": 5.473225404732254,
+ "grad_norm": 0.6575281023979187,
+ "learning_rate": 0.00011431860908416465,
+ "loss": 0.1452319622039795,
+ "mean_token_accuracy": 0.9505287684500218,
+ "num_tokens": 5135109.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.473225404732254,
+ "eval_entropy": 0.3488145174328671,
+ "eval_loss": 0.6612305641174316,
+ "eval_mean_token_accuracy": 0.8492907808963642,
+ "eval_num_tokens": 5135109.0,
+ "eval_runtime": 86.6927,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 2200
+ },
+ {
+ "entropy": 0.23091202937066554,
+ "epoch": 5.523038605230386,
+ "grad_norm": 0.8909686207771301,
+ "learning_rate": 0.00011235380014440985,
+ "loss": 0.15150139331817628,
+ "mean_token_accuracy": 0.9497875183820724,
+ "num_tokens": 5180138.0,
+ "step": 2220
+ },
+ {
+ "epoch": 5.523038605230386,
+ "eval_entropy": 0.3268539015810157,
+ "eval_loss": 0.6667542457580566,
+ "eval_mean_token_accuracy": 0.8499062903398691,
+ "eval_num_tokens": 5180138.0,
+ "eval_runtime": 86.4644,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 2220
+ },
+ {
+ "entropy": 0.2227974807843566,
+ "epoch": 5.572851805728518,
+ "grad_norm": 0.6180275082588196,
+ "learning_rate": 0.0001103892282299158,
+ "loss": 0.1491069197654724,
+ "mean_token_accuracy": 0.9488144010305405,
+ "num_tokens": 5226864.0,
+ "step": 2240
+ },
+ {
+ "epoch": 5.572851805728518,
+ "eval_entropy": 0.3346347655494546,
+ "eval_loss": 0.6665948629379272,
+ "eval_mean_token_accuracy": 0.8499961893918903,
+ "eval_num_tokens": 5226864.0,
+ "eval_runtime": 87.0548,
+ "eval_samples_per_second": 15.795,
+ "eval_steps_per_second": 1.976,
+ "step": 2240
+ },
+ {
+ "entropy": 0.21368421968072654,
+ "epoch": 5.62266500622665,
+ "grad_norm": 0.6004369258880615,
+ "learning_rate": 0.00010842548582877651,
+ "loss": 0.14485255479812623,
+ "mean_token_accuracy": 0.9502056457102299,
+ "num_tokens": 5276602.0,
+ "step": 2260
+ },
+ {
+ "epoch": 5.62266500622665,
+ "eval_entropy": 0.32753298804163933,
+ "eval_loss": 0.6680151224136353,
+ "eval_mean_token_accuracy": 0.8515451086121936,
+ "eval_num_tokens": 5276602.0,
+ "eval_runtime": 86.8524,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.98,
+ "step": 2260
+ },
+ {
+ "entropy": 0.2103635374456644,
+ "epoch": 5.672478206724782,
+ "grad_norm": 0.699174702167511,
+ "learning_rate": 0.00010646316517891613,
+ "loss": 0.14297772645950318,
+ "mean_token_accuracy": 0.9512537539005279,
+ "num_tokens": 5323718.0,
+ "step": 2280
+ },
+ {
+ "epoch": 5.672478206724782,
+ "eval_entropy": 0.32966585959806,
+ "eval_loss": 0.675578773021698,
+ "eval_mean_token_accuracy": 0.8509623023659684,
+ "eval_num_tokens": 5323718.0,
+ "eval_runtime": 86.4518,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2280
+ },
+ {
+ "entropy": 0.22516900151968003,
+ "epoch": 5.722291407222914,
+ "grad_norm": 0.6637354493141174,
+ "learning_rate": 0.00010450285808947797,
+ "loss": 0.15202572345733642,
+ "mean_token_accuracy": 0.9482452072203159,
+ "num_tokens": 5369039.0,
+ "step": 2300
+ },
+ {
+ "epoch": 5.722291407222914,
+ "eval_entropy": 0.3369456917740578,
+ "eval_loss": 0.6697061061859131,
+ "eval_mean_token_accuracy": 0.848603522361711,
+ "eval_num_tokens": 5369039.0,
+ "eval_runtime": 86.6371,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.985,
+ "step": 2300
+ },
+ {
+ "entropy": 0.21841065725311637,
+ "epoch": 5.772104607721046,
+ "grad_norm": 0.7940268516540527,
+ "learning_rate": 0.00010254515576234297,
+ "loss": 0.14710167646408082,
+ "mean_token_accuracy": 0.9493498183786869,
+ "num_tokens": 5417029.0,
+ "step": 2320
+ },
+ {
+ "epoch": 5.772104607721046,
+ "eval_entropy": 0.3237486180177955,
+ "eval_loss": 0.6779657602310181,
+ "eval_mean_token_accuracy": 0.8500715313955794,
+ "eval_num_tokens": 5417029.0,
+ "eval_runtime": 86.1826,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 1.996,
+ "step": 2320
+ },
+ {
+ "entropy": 0.22146204356104135,
+ "epoch": 5.821917808219178,
+ "grad_norm": 0.9234833121299744,
+ "learning_rate": 0.00010059064861383132,
+ "loss": 0.14720046520233154,
+ "mean_token_accuracy": 0.9493872679769992,
+ "num_tokens": 5461671.0,
+ "step": 2340
+ },
+ {
+ "epoch": 5.821917808219178,
+ "eval_entropy": 0.32365207564692167,
+ "eval_loss": 0.6704005002975464,
+ "eval_mean_token_accuracy": 0.8507985760306203,
+ "eval_num_tokens": 5461671.0,
+ "eval_runtime": 86.5494,
+ "eval_samples_per_second": 15.887,
+ "eval_steps_per_second": 1.987,
+ "step": 2340
+ },
+ {
+ "entropy": 0.20934011954814197,
+ "epoch": 5.87173100871731,
+ "grad_norm": 0.5547503232955933,
+ "learning_rate": 9.863992609664084e-05,
+ "loss": 0.1464867353439331,
+ "mean_token_accuracy": 0.9503875687718392,
+ "num_tokens": 5509312.0,
+ "step": 2360
+ },
+ {
+ "epoch": 5.87173100871731,
+ "eval_entropy": 0.3330401429083458,
+ "eval_loss": 0.6659091114997864,
+ "eval_mean_token_accuracy": 0.8504848906467127,
+ "eval_num_tokens": 5509312.0,
+ "eval_runtime": 86.5855,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 2360
+ },
+ {
+ "entropy": 0.21678635366261007,
+ "epoch": 5.921544209215442,
+ "grad_norm": 0.570612907409668,
+ "learning_rate": 9.669357652207635e-05,
+ "loss": 0.14821385145187377,
+ "mean_token_accuracy": 0.9503940217196941,
+ "num_tokens": 5558196.0,
+ "step": 2380
+ },
+ {
+ "epoch": 5.921544209215442,
+ "eval_entropy": 0.3322022325077722,
+ "eval_loss": 0.6722489595413208,
+ "eval_mean_token_accuracy": 0.8489979422369669,
+ "eval_num_tokens": 5558196.0,
+ "eval_runtime": 86.2986,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 2380
+ },
+ {
+ "entropy": 0.20932920072227718,
+ "epoch": 5.971357409713574,
+ "grad_norm": 0.7879557609558105,
+ "learning_rate": 9.475218688262262e-05,
+ "loss": 0.14675841331481934,
+ "mean_token_accuracy": 0.9507176131010056,
+ "num_tokens": 5605400.0,
+ "step": 2400
+ },
+ {
+ "epoch": 5.971357409713574,
+ "eval_entropy": 0.3199348642902319,
+ "eval_loss": 0.6698136329650879,
+ "eval_mean_token_accuracy": 0.8514142130003419,
+ "eval_num_tokens": 5605400.0,
+ "eval_runtime": 85.8995,
+ "eval_samples_per_second": 16.007,
+ "eval_steps_per_second": 2.002,
+ "step": 2400
+ },
+ {
+ "entropy": 0.21032143919131693,
+ "epoch": 6.019925280199253,
+ "grad_norm": 0.5823076367378235,
+ "learning_rate": 9.281634267491569e-05,
+ "loss": 0.13322267532348633,
+ "mean_token_accuracy": 0.9550939072401096,
+ "num_tokens": 5648968.0,
+ "step": 2420
+ },
+ {
+ "epoch": 6.019925280199253,
+ "eval_entropy": 0.30206270117399303,
+ "eval_loss": 0.7093168497085571,
+ "eval_mean_token_accuracy": 0.8500627639681794,
+ "eval_num_tokens": 5648968.0,
+ "eval_runtime": 85.8128,
+ "eval_samples_per_second": 16.023,
+ "eval_steps_per_second": 2.004,
+ "step": 2420
+ },
+ {
+ "entropy": 0.1534628233872354,
+ "epoch": 6.069738480697385,
+ "grad_norm": 0.710133969783783,
+ "learning_rate": 9.088662772316508e-05,
+ "loss": 0.09078952670097351,
+ "mean_token_accuracy": 0.9678447999060154,
+ "num_tokens": 5697633.0,
+ "step": 2440
+ },
+ {
+ "epoch": 6.069738480697385,
+ "eval_entropy": 0.28208133101809857,
+ "eval_loss": 0.7636417150497437,
+ "eval_mean_token_accuracy": 0.8494061477655588,
+ "eval_num_tokens": 5697633.0,
+ "eval_runtime": 85.9724,
+ "eval_samples_per_second": 15.994,
+ "eval_steps_per_second": 2.001,
+ "step": 2440
+ },
+ {
+ "entropy": 0.16151462448760867,
+ "epoch": 6.119551681195516,
+ "grad_norm": 0.5793812274932861,
+ "learning_rate": 8.896362400308028e-05,
+ "loss": 0.09545697569847107,
+ "mean_token_accuracy": 0.9671573750674725,
+ "num_tokens": 5745090.0,
+ "step": 2460
+ },
+ {
+ "epoch": 6.119551681195516,
+ "eval_entropy": 0.2833245605403601,
+ "eval_loss": 0.7402405738830566,
+ "eval_mean_token_accuracy": 0.8503523728875226,
+ "eval_num_tokens": 5745090.0,
+ "eval_runtime": 85.5461,
+ "eval_samples_per_second": 16.073,
+ "eval_steps_per_second": 2.011,
+ "step": 2460
+ },
+ {
+ "entropy": 0.15203177919611335,
+ "epoch": 6.169364881693649,
+ "grad_norm": 0.4251123368740082,
+ "learning_rate": 8.704791146635483e-05,
+ "loss": 0.09420782327651978,
+ "mean_token_accuracy": 0.9677386932075024,
+ "num_tokens": 5790333.0,
+ "step": 2480
+ },
+ {
+ "epoch": 6.169364881693649,
+ "eval_entropy": 0.28572545962971313,
+ "eval_loss": 0.735416829586029,
+ "eval_mean_token_accuracy": 0.8487084663884584,
+ "eval_num_tokens": 5790333.0,
+ "eval_runtime": 85.4801,
+ "eval_samples_per_second": 16.086,
+ "eval_steps_per_second": 2.012,
+ "step": 2480
+ },
+ {
+ "entropy": 0.15587336672469973,
+ "epoch": 6.219178082191781,
+ "grad_norm": 0.4357028007507324,
+ "learning_rate": 8.514006786576085e-05,
+ "loss": 0.09429320096969604,
+ "mean_token_accuracy": 0.9682952925562859,
+ "num_tokens": 5837321.0,
+ "step": 2500
+ },
+ {
+ "epoch": 6.219178082191781,
+ "eval_entropy": 0.2859006894882335,
+ "eval_loss": 0.7347224950790405,
+ "eval_mean_token_accuracy": 0.8501905518215757,
+ "eval_num_tokens": 5837321.0,
+ "eval_runtime": 85.7578,
+ "eval_samples_per_second": 16.034,
+ "eval_steps_per_second": 2.006,
+ "step": 2500
+ },
+ {
+ "entropy": 0.15765639198943973,
+ "epoch": 6.268991282689913,
+ "grad_norm": 0.47331130504608154,
+ "learning_rate": 8.324066858090663e-05,
+ "loss": 0.09571113586425781,
+ "mean_token_accuracy": 0.9683481335639954,
+ "num_tokens": 5884398.0,
+ "step": 2520
+ },
+ {
+ "epoch": 6.268991282689913,
+ "eval_entropy": 0.29231513846059176,
+ "eval_loss": 0.7392512559890747,
+ "eval_mean_token_accuracy": 0.8486633983462356,
+ "eval_num_tokens": 5884398.0,
+ "eval_runtime": 85.7846,
+ "eval_samples_per_second": 16.029,
+ "eval_steps_per_second": 2.005,
+ "step": 2520
+ },
+ {
+ "entropy": 0.16176860257983208,
+ "epoch": 6.318804483188045,
+ "grad_norm": 0.6142018437385559,
+ "learning_rate": 8.135028644470992e-05,
+ "loss": 0.09486144185066223,
+ "mean_token_accuracy": 0.9682316601276397,
+ "num_tokens": 5929876.0,
+ "step": 2540
+ },
+ {
+ "epoch": 6.318804483188045,
+ "eval_entropy": 0.2851274753379267,
+ "eval_loss": 0.7520816922187805,
+ "eval_mean_token_accuracy": 0.8501113649717597,
+ "eval_num_tokens": 5929876.0,
+ "eval_runtime": 85.9425,
+ "eval_samples_per_second": 15.999,
+ "eval_steps_per_second": 2.001,
+ "step": 2540
+ },
+ {
+ "entropy": 0.15404034564271568,
+ "epoch": 6.3686176836861765,
+ "grad_norm": 0.6051287651062012,
+ "learning_rate": 7.946949157063964e-05,
+ "loss": 0.09280472993850708,
+ "mean_token_accuracy": 0.9684635892510414,
+ "num_tokens": 5978490.0,
+ "step": 2560
+ },
+ {
+ "epoch": 6.3686176836861765,
+ "eval_entropy": 0.28802703563557114,
+ "eval_loss": 0.7439162135124207,
+ "eval_mean_token_accuracy": 0.8499851770872293,
+ "eval_num_tokens": 5978490.0,
+ "eval_runtime": 86.0703,
+ "eval_samples_per_second": 15.975,
+ "eval_steps_per_second": 1.998,
+ "step": 2560
+ },
+ {
+ "entropy": 0.15343588953837753,
+ "epoch": 6.418430884184309,
+ "grad_norm": 0.4823743402957916,
+ "learning_rate": 7.759885118077701e-05,
+ "loss": 0.09000591039657593,
+ "mean_token_accuracy": 0.9699928767979145,
+ "num_tokens": 6025380.0,
+ "step": 2580
+ },
+ {
+ "epoch": 6.418430884184309,
+ "eval_entropy": 0.2795634938533916,
+ "eval_loss": 0.7647850513458252,
+ "eval_mean_token_accuracy": 0.8503464397995971,
+ "eval_num_tokens": 6025380.0,
+ "eval_runtime": 85.8886,
+ "eval_samples_per_second": 16.009,
+ "eval_steps_per_second": 2.003,
+ "step": 2580
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.5429140091268506e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-260/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-260/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-260/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-260/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-260/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-260/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-260/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-260/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-260/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-260/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-260/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-260/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-260/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-260/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..b3479b74945bc3176f4b212b4d58fa144a5b1c9a
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-260/trainer_state.json
@@ -0,0 +1,307 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 0.6475716064757161,
+ "eval_steps": 20,
+ "global_step": 260,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.606270446932787e+16,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2600/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2600/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2600/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2600/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2600/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2600/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2600/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2600/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2600/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2600/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2600/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2600/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2600/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2600/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..edaef036f32edb93cb3a4a0bea47c9c8c900400a
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2600/trainer_state.json
@@ -0,0 +1,2764 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 6.468244084682441,
+ "eval_steps": 20,
+ "global_step": 2600,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ },
+ {
+ "entropy": 0.3193941755220294,
+ "epoch": 4.5280199252802,
+ "grad_norm": 0.8281906843185425,
+ "learning_rate": 0.0001509111761786888,
+ "loss": 0.23936262130737304,
+ "mean_token_accuracy": 0.9201708927750587,
+ "num_tokens": 4244423.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.5280199252802,
+ "eval_entropy": 0.38704028864239537,
+ "eval_loss": 0.6006569266319275,
+ "eval_mean_token_accuracy": 0.8502406720505205,
+ "eval_num_tokens": 4244423.0,
+ "eval_runtime": 86.8059,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1820
+ },
+ {
+ "entropy": 0.3164879363030195,
+ "epoch": 4.577833125778331,
+ "grad_norm": 0.7892968654632568,
+ "learning_rate": 0.00014905346557909867,
+ "loss": 0.24541733264923096,
+ "mean_token_accuracy": 0.9175932116806507,
+ "num_tokens": 4289773.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.577833125778331,
+ "eval_entropy": 0.38861122120951497,
+ "eval_loss": 0.6115967631340027,
+ "eval_mean_token_accuracy": 0.849471275196519,
+ "eval_num_tokens": 4289773.0,
+ "eval_runtime": 86.2946,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1840
+ },
+ {
+ "entropy": 0.3051785985007882,
+ "epoch": 4.627646326276463,
+ "grad_norm": 0.8109654188156128,
+ "learning_rate": 0.0001471849238862319,
+ "loss": 0.23433220386505127,
+ "mean_token_accuracy": 0.9206570319831371,
+ "num_tokens": 4336894.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.627646326276463,
+ "eval_entropy": 0.37162452295076015,
+ "eval_loss": 0.6184061765670776,
+ "eval_mean_token_accuracy": 0.8501173268223918,
+ "eval_num_tokens": 4336894.0,
+ "eval_runtime": 86.6865,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1860
+ },
+ {
+ "entropy": 0.3168198253959417,
+ "epoch": 4.677459526774595,
+ "grad_norm": 0.9512342214584351,
+ "learning_rate": 0.0001453061146267775,
+ "loss": 0.23832404613494873,
+ "mean_token_accuracy": 0.9197044663131237,
+ "num_tokens": 4382947.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.677459526774595,
+ "eval_entropy": 0.3845940856912801,
+ "eval_loss": 0.606762707233429,
+ "eval_mean_token_accuracy": 0.8504838194957999,
+ "eval_num_tokens": 4382947.0,
+ "eval_runtime": 86.5175,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 1880
+ },
+ {
+ "entropy": 0.30791807882487776,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 0.8123113512992859,
+ "learning_rate": 0.00014341760442398248,
+ "loss": 0.2395785331726074,
+ "mean_token_accuracy": 0.918928150832653,
+ "num_tokens": 4433050.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.7272727272727275,
+ "eval_entropy": 0.39762327222283494,
+ "eval_loss": 0.5994202494621277,
+ "eval_mean_token_accuracy": 0.8509274201337681,
+ "eval_num_tokens": 4433050.0,
+ "eval_runtime": 86.2873,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.993,
+ "step": 1900
+ },
+ {
+ "entropy": 0.3021434534341097,
+ "epoch": 4.777085927770859,
+ "grad_norm": 0.731787383556366,
+ "learning_rate": 0.000141519962826766,
+ "loss": 0.23494718074798585,
+ "mean_token_accuracy": 0.9201403826475143,
+ "num_tokens": 4483598.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.777085927770859,
+ "eval_entropy": 0.3827026732439219,
+ "eval_loss": 0.5995895862579346,
+ "eval_mean_token_accuracy": 0.851468373523202,
+ "eval_num_tokens": 4483598.0,
+ "eval_runtime": 86.3006,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 1920
+ },
+ {
+ "entropy": 0.31626159623265265,
+ "epoch": 4.826899128268991,
+ "grad_norm": 0.8848487138748169,
+ "learning_rate": 0.00013961376213795132,
+ "loss": 0.2439030647277832,
+ "mean_token_accuracy": 0.9196575872600079,
+ "num_tokens": 4529201.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.826899128268991,
+ "eval_entropy": 0.388698436839636,
+ "eval_loss": 0.6000174283981323,
+ "eval_mean_token_accuracy": 0.8518068187458571,
+ "eval_num_tokens": 4529201.0,
+ "eval_runtime": 86.8979,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.979,
+ "step": 1940
+ },
+ {
+ "entropy": 0.30520407035946845,
+ "epoch": 4.876712328767123,
+ "grad_norm": 0.8532460927963257,
+ "learning_rate": 0.00013769957724166695,
+ "loss": 0.23458616733551024,
+ "mean_token_accuracy": 0.9221912942826748,
+ "num_tokens": 4578167.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.876712328767123,
+ "eval_entropy": 0.38777847102908203,
+ "eval_loss": 0.6004981398582458,
+ "eval_mean_token_accuracy": 0.8516481768253238,
+ "eval_num_tokens": 4578167.0,
+ "eval_runtime": 87.0777,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.975,
+ "step": 1960
+ },
+ {
+ "entropy": 0.3226448342204094,
+ "epoch": 4.926525529265255,
+ "grad_norm": 0.6945561766624451,
+ "learning_rate": 0.0001357779854299694,
+ "loss": 0.24048397541046143,
+ "mean_token_accuracy": 0.9195300146937371,
+ "num_tokens": 4622316.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.926525529265255,
+ "eval_entropy": 0.38581624263247777,
+ "eval_loss": 0.6029234528541565,
+ "eval_mean_token_accuracy": 0.8514213260523108,
+ "eval_num_tokens": 4622316.0,
+ "eval_runtime": 85.8729,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 1980
+ },
+ {
+ "entropy": 0.3051655298098922,
+ "epoch": 4.976338729763388,
+ "grad_norm": 0.7976452708244324,
+ "learning_rate": 0.00013384956622874001,
+ "loss": 0.23584742546081544,
+ "mean_token_accuracy": 0.9216851457953453,
+ "num_tokens": 4670746.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.976338729763388,
+ "eval_entropy": 0.37913159246361533,
+ "eval_loss": 0.6057604551315308,
+ "eval_mean_token_accuracy": 0.8525801203971686,
+ "eval_num_tokens": 4670746.0,
+ "eval_runtime": 86.1145,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2000
+ },
+ {
+ "entropy": 0.27438195240803254,
+ "epoch": 5.024906600249066,
+ "grad_norm": 0.6729586124420166,
+ "learning_rate": 0.0001319149012229075,
+ "loss": 0.19775952100753785,
+ "mean_token_accuracy": 0.9339428559327737,
+ "num_tokens": 4716176.0,
+ "step": 2020
+ },
+ {
+ "epoch": 5.024906600249066,
+ "eval_entropy": 0.3448961910813354,
+ "eval_loss": 0.6750120520591736,
+ "eval_mean_token_accuracy": 0.8487970232963562,
+ "eval_num_tokens": 4716176.0,
+ "eval_runtime": 86.1169,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2020
+ },
+ {
+ "entropy": 0.21423916313797237,
+ "epoch": 5.074719800747198,
+ "grad_norm": 0.6934391856193542,
+ "learning_rate": 0.00012997457388105022,
+ "loss": 0.1439570426940918,
+ "mean_token_accuracy": 0.9528236843645572,
+ "num_tokens": 4763269.0,
+ "step": 2040
+ },
+ {
+ "epoch": 5.074719800747198,
+ "eval_entropy": 0.3570949243771475,
+ "eval_loss": 0.6465504169464111,
+ "eval_mean_token_accuracy": 0.8490785547467166,
+ "eval_num_tokens": 4763269.0,
+ "eval_runtime": 85.9574,
+ "eval_samples_per_second": 15.996,
+ "eval_steps_per_second": 2.001,
+ "step": 2040
+ },
+ {
+ "entropy": 0.20838565267622472,
+ "epoch": 5.12453300124533,
+ "grad_norm": 0.7286986112594604,
+ "learning_rate": 0.00012802916937942972,
+ "loss": 0.14467307329177856,
+ "mean_token_accuracy": 0.950994835793972,
+ "num_tokens": 4809047.0,
+ "step": 2060
+ },
+ {
+ "epoch": 5.12453300124533,
+ "eval_entropy": 0.3452463157821533,
+ "eval_loss": 0.6705958843231201,
+ "eval_mean_token_accuracy": 0.8490352796953778,
+ "eval_num_tokens": 4809047.0,
+ "eval_runtime": 86.228,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 2060
+ },
+ {
+ "entropy": 0.20453082229942082,
+ "epoch": 5.174346201743462,
+ "grad_norm": 0.7515555620193481,
+ "learning_rate": 0.00012607927442550974,
+ "loss": 0.13732000589370727,
+ "mean_token_accuracy": 0.9537357829511166,
+ "num_tokens": 4857965.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.174346201743462,
+ "eval_entropy": 0.32431264914745506,
+ "eval_loss": 0.6743043065071106,
+ "eval_mean_token_accuracy": 0.8504878629085629,
+ "eval_num_tokens": 4857965.0,
+ "eval_runtime": 86.5948,
+ "eval_samples_per_second": 15.879,
+ "eval_steps_per_second": 1.986,
+ "step": 2080
+ },
+ {
+ "entropy": 0.21812320686876774,
+ "epoch": 5.224159402241594,
+ "grad_norm": 0.9093465209007263,
+ "learning_rate": 0.0001241254770810132,
+ "loss": 0.14311420917510986,
+ "mean_token_accuracy": 0.9514068141579628,
+ "num_tokens": 4905151.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.224159402241594,
+ "eval_entropy": 0.33086285835435225,
+ "eval_loss": 0.6676449179649353,
+ "eval_mean_token_accuracy": 0.8505287662495015,
+ "eval_num_tokens": 4905151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 2100
+ },
+ {
+ "entropy": 0.2180163251236081,
+ "epoch": 5.273972602739726,
+ "grad_norm": 0.6703007221221924,
+ "learning_rate": 0.00012216836658457075,
+ "loss": 0.14803968667984008,
+ "mean_token_accuracy": 0.9521303348243236,
+ "num_tokens": 4947072.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.273972602739726,
+ "eval_entropy": 0.33162341708707255,
+ "eval_loss": 0.6658875942230225,
+ "eval_mean_token_accuracy": 0.8500757605530495,
+ "eval_num_tokens": 4947072.0,
+ "eval_runtime": 86.6296,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 2120
+ },
+ {
+ "entropy": 0.22511130161583423,
+ "epoch": 5.323785803237858,
+ "grad_norm": 0.8078880906105042,
+ "learning_rate": 0.00012020853317401455,
+ "loss": 0.15228408575057983,
+ "mean_token_accuracy": 0.947144789993763,
+ "num_tokens": 4991974.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.323785803237858,
+ "eval_entropy": 0.3354601170434508,
+ "eval_loss": 0.6677829623222351,
+ "eval_mean_token_accuracy": 0.8482600024273229,
+ "eval_num_tokens": 4991974.0,
+ "eval_runtime": 86.4689,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.989,
+ "step": 2140
+ },
+ {
+ "entropy": 0.2244176059961319,
+ "epoch": 5.37359900373599,
+ "grad_norm": 0.9636075496673584,
+ "learning_rate": 0.00011824656790837037,
+ "loss": 0.15260883569717407,
+ "mean_token_accuracy": 0.9471467643976211,
+ "num_tokens": 5038400.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.37359900373599,
+ "eval_entropy": 0.3381616926297199,
+ "eval_loss": 0.6694412231445312,
+ "eval_mean_token_accuracy": 0.8482369603805764,
+ "eval_num_tokens": 5038400.0,
+ "eval_runtime": 86.4147,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 2160
+ },
+ {
+ "entropy": 0.22982364390045404,
+ "epoch": 5.423412204234122,
+ "grad_norm": 0.775401771068573,
+ "learning_rate": 0.00011628306248960262,
+ "loss": 0.15140302181243898,
+ "mean_token_accuracy": 0.9492553934454918,
+ "num_tokens": 5083166.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.423412204234122,
+ "eval_entropy": 0.3305150235808173,
+ "eval_loss": 0.6717822551727295,
+ "eval_mean_token_accuracy": 0.8489849723355715,
+ "eval_num_tokens": 5083166.0,
+ "eval_runtime": 86.4728,
+ "eval_samples_per_second": 15.901,
+ "eval_steps_per_second": 1.989,
+ "step": 2180
+ },
+ {
+ "entropy": 0.21448935717344284,
+ "epoch": 5.473225404732254,
+ "grad_norm": 0.6575281023979187,
+ "learning_rate": 0.00011431860908416465,
+ "loss": 0.1452319622039795,
+ "mean_token_accuracy": 0.9505287684500218,
+ "num_tokens": 5135109.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.473225404732254,
+ "eval_entropy": 0.3488145174328671,
+ "eval_loss": 0.6612305641174316,
+ "eval_mean_token_accuracy": 0.8492907808963642,
+ "eval_num_tokens": 5135109.0,
+ "eval_runtime": 86.6927,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 2200
+ },
+ {
+ "entropy": 0.23091202937066554,
+ "epoch": 5.523038605230386,
+ "grad_norm": 0.8909686207771301,
+ "learning_rate": 0.00011235380014440985,
+ "loss": 0.15150139331817628,
+ "mean_token_accuracy": 0.9497875183820724,
+ "num_tokens": 5180138.0,
+ "step": 2220
+ },
+ {
+ "epoch": 5.523038605230386,
+ "eval_entropy": 0.3268539015810157,
+ "eval_loss": 0.6667542457580566,
+ "eval_mean_token_accuracy": 0.8499062903398691,
+ "eval_num_tokens": 5180138.0,
+ "eval_runtime": 86.4644,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 2220
+ },
+ {
+ "entropy": 0.2227974807843566,
+ "epoch": 5.572851805728518,
+ "grad_norm": 0.6180275082588196,
+ "learning_rate": 0.0001103892282299158,
+ "loss": 0.1491069197654724,
+ "mean_token_accuracy": 0.9488144010305405,
+ "num_tokens": 5226864.0,
+ "step": 2240
+ },
+ {
+ "epoch": 5.572851805728518,
+ "eval_entropy": 0.3346347655494546,
+ "eval_loss": 0.6665948629379272,
+ "eval_mean_token_accuracy": 0.8499961893918903,
+ "eval_num_tokens": 5226864.0,
+ "eval_runtime": 87.0548,
+ "eval_samples_per_second": 15.795,
+ "eval_steps_per_second": 1.976,
+ "step": 2240
+ },
+ {
+ "entropy": 0.21368421968072654,
+ "epoch": 5.62266500622665,
+ "grad_norm": 0.6004369258880615,
+ "learning_rate": 0.00010842548582877651,
+ "loss": 0.14485255479812623,
+ "mean_token_accuracy": 0.9502056457102299,
+ "num_tokens": 5276602.0,
+ "step": 2260
+ },
+ {
+ "epoch": 5.62266500622665,
+ "eval_entropy": 0.32753298804163933,
+ "eval_loss": 0.6680151224136353,
+ "eval_mean_token_accuracy": 0.8515451086121936,
+ "eval_num_tokens": 5276602.0,
+ "eval_runtime": 86.8524,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.98,
+ "step": 2260
+ },
+ {
+ "entropy": 0.2103635374456644,
+ "epoch": 5.672478206724782,
+ "grad_norm": 0.699174702167511,
+ "learning_rate": 0.00010646316517891613,
+ "loss": 0.14297772645950318,
+ "mean_token_accuracy": 0.9512537539005279,
+ "num_tokens": 5323718.0,
+ "step": 2280
+ },
+ {
+ "epoch": 5.672478206724782,
+ "eval_entropy": 0.32966585959806,
+ "eval_loss": 0.675578773021698,
+ "eval_mean_token_accuracy": 0.8509623023659684,
+ "eval_num_tokens": 5323718.0,
+ "eval_runtime": 86.4518,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2280
+ },
+ {
+ "entropy": 0.22516900151968003,
+ "epoch": 5.722291407222914,
+ "grad_norm": 0.6637354493141174,
+ "learning_rate": 0.00010450285808947797,
+ "loss": 0.15202572345733642,
+ "mean_token_accuracy": 0.9482452072203159,
+ "num_tokens": 5369039.0,
+ "step": 2300
+ },
+ {
+ "epoch": 5.722291407222914,
+ "eval_entropy": 0.3369456917740578,
+ "eval_loss": 0.6697061061859131,
+ "eval_mean_token_accuracy": 0.848603522361711,
+ "eval_num_tokens": 5369039.0,
+ "eval_runtime": 86.6371,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.985,
+ "step": 2300
+ },
+ {
+ "entropy": 0.21841065725311637,
+ "epoch": 5.772104607721046,
+ "grad_norm": 0.7940268516540527,
+ "learning_rate": 0.00010254515576234297,
+ "loss": 0.14710167646408082,
+ "mean_token_accuracy": 0.9493498183786869,
+ "num_tokens": 5417029.0,
+ "step": 2320
+ },
+ {
+ "epoch": 5.772104607721046,
+ "eval_entropy": 0.3237486180177955,
+ "eval_loss": 0.6779657602310181,
+ "eval_mean_token_accuracy": 0.8500715313955794,
+ "eval_num_tokens": 5417029.0,
+ "eval_runtime": 86.1826,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 1.996,
+ "step": 2320
+ },
+ {
+ "entropy": 0.22146204356104135,
+ "epoch": 5.821917808219178,
+ "grad_norm": 0.9234833121299744,
+ "learning_rate": 0.00010059064861383132,
+ "loss": 0.14720046520233154,
+ "mean_token_accuracy": 0.9493872679769992,
+ "num_tokens": 5461671.0,
+ "step": 2340
+ },
+ {
+ "epoch": 5.821917808219178,
+ "eval_entropy": 0.32365207564692167,
+ "eval_loss": 0.6704005002975464,
+ "eval_mean_token_accuracy": 0.8507985760306203,
+ "eval_num_tokens": 5461671.0,
+ "eval_runtime": 86.5494,
+ "eval_samples_per_second": 15.887,
+ "eval_steps_per_second": 1.987,
+ "step": 2340
+ },
+ {
+ "entropy": 0.20934011954814197,
+ "epoch": 5.87173100871731,
+ "grad_norm": 0.5547503232955933,
+ "learning_rate": 9.863992609664084e-05,
+ "loss": 0.1464867353439331,
+ "mean_token_accuracy": 0.9503875687718392,
+ "num_tokens": 5509312.0,
+ "step": 2360
+ },
+ {
+ "epoch": 5.87173100871731,
+ "eval_entropy": 0.3330401429083458,
+ "eval_loss": 0.6659091114997864,
+ "eval_mean_token_accuracy": 0.8504848906467127,
+ "eval_num_tokens": 5509312.0,
+ "eval_runtime": 86.5855,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 2360
+ },
+ {
+ "entropy": 0.21678635366261007,
+ "epoch": 5.921544209215442,
+ "grad_norm": 0.570612907409668,
+ "learning_rate": 9.669357652207635e-05,
+ "loss": 0.14821385145187377,
+ "mean_token_accuracy": 0.9503940217196941,
+ "num_tokens": 5558196.0,
+ "step": 2380
+ },
+ {
+ "epoch": 5.921544209215442,
+ "eval_entropy": 0.3322022325077722,
+ "eval_loss": 0.6722489595413208,
+ "eval_mean_token_accuracy": 0.8489979422369669,
+ "eval_num_tokens": 5558196.0,
+ "eval_runtime": 86.2986,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 2380
+ },
+ {
+ "entropy": 0.20932920072227718,
+ "epoch": 5.971357409713574,
+ "grad_norm": 0.7879557609558105,
+ "learning_rate": 9.475218688262262e-05,
+ "loss": 0.14675841331481934,
+ "mean_token_accuracy": 0.9507176131010056,
+ "num_tokens": 5605400.0,
+ "step": 2400
+ },
+ {
+ "epoch": 5.971357409713574,
+ "eval_entropy": 0.3199348642902319,
+ "eval_loss": 0.6698136329650879,
+ "eval_mean_token_accuracy": 0.8514142130003419,
+ "eval_num_tokens": 5605400.0,
+ "eval_runtime": 85.8995,
+ "eval_samples_per_second": 16.007,
+ "eval_steps_per_second": 2.002,
+ "step": 2400
+ },
+ {
+ "entropy": 0.21032143919131693,
+ "epoch": 6.019925280199253,
+ "grad_norm": 0.5823076367378235,
+ "learning_rate": 9.281634267491569e-05,
+ "loss": 0.13322267532348633,
+ "mean_token_accuracy": 0.9550939072401096,
+ "num_tokens": 5648968.0,
+ "step": 2420
+ },
+ {
+ "epoch": 6.019925280199253,
+ "eval_entropy": 0.30206270117399303,
+ "eval_loss": 0.7093168497085571,
+ "eval_mean_token_accuracy": 0.8500627639681794,
+ "eval_num_tokens": 5648968.0,
+ "eval_runtime": 85.8128,
+ "eval_samples_per_second": 16.023,
+ "eval_steps_per_second": 2.004,
+ "step": 2420
+ },
+ {
+ "entropy": 0.1534628233872354,
+ "epoch": 6.069738480697385,
+ "grad_norm": 0.710133969783783,
+ "learning_rate": 9.088662772316508e-05,
+ "loss": 0.09078952670097351,
+ "mean_token_accuracy": 0.9678447999060154,
+ "num_tokens": 5697633.0,
+ "step": 2440
+ },
+ {
+ "epoch": 6.069738480697385,
+ "eval_entropy": 0.28208133101809857,
+ "eval_loss": 0.7636417150497437,
+ "eval_mean_token_accuracy": 0.8494061477655588,
+ "eval_num_tokens": 5697633.0,
+ "eval_runtime": 85.9724,
+ "eval_samples_per_second": 15.994,
+ "eval_steps_per_second": 2.001,
+ "step": 2440
+ },
+ {
+ "entropy": 0.16151462448760867,
+ "epoch": 6.119551681195516,
+ "grad_norm": 0.5793812274932861,
+ "learning_rate": 8.896362400308028e-05,
+ "loss": 0.09545697569847107,
+ "mean_token_accuracy": 0.9671573750674725,
+ "num_tokens": 5745090.0,
+ "step": 2460
+ },
+ {
+ "epoch": 6.119551681195516,
+ "eval_entropy": 0.2833245605403601,
+ "eval_loss": 0.7402405738830566,
+ "eval_mean_token_accuracy": 0.8503523728875226,
+ "eval_num_tokens": 5745090.0,
+ "eval_runtime": 85.5461,
+ "eval_samples_per_second": 16.073,
+ "eval_steps_per_second": 2.011,
+ "step": 2460
+ },
+ {
+ "entropy": 0.15203177919611335,
+ "epoch": 6.169364881693649,
+ "grad_norm": 0.4251123368740082,
+ "learning_rate": 8.704791146635483e-05,
+ "loss": 0.09420782327651978,
+ "mean_token_accuracy": 0.9677386932075024,
+ "num_tokens": 5790333.0,
+ "step": 2480
+ },
+ {
+ "epoch": 6.169364881693649,
+ "eval_entropy": 0.28572545962971313,
+ "eval_loss": 0.735416829586029,
+ "eval_mean_token_accuracy": 0.8487084663884584,
+ "eval_num_tokens": 5790333.0,
+ "eval_runtime": 85.4801,
+ "eval_samples_per_second": 16.086,
+ "eval_steps_per_second": 2.012,
+ "step": 2480
+ },
+ {
+ "entropy": 0.15587336672469973,
+ "epoch": 6.219178082191781,
+ "grad_norm": 0.4357028007507324,
+ "learning_rate": 8.514006786576085e-05,
+ "loss": 0.09429320096969604,
+ "mean_token_accuracy": 0.9682952925562859,
+ "num_tokens": 5837321.0,
+ "step": 2500
+ },
+ {
+ "epoch": 6.219178082191781,
+ "eval_entropy": 0.2859006894882335,
+ "eval_loss": 0.7347224950790405,
+ "eval_mean_token_accuracy": 0.8501905518215757,
+ "eval_num_tokens": 5837321.0,
+ "eval_runtime": 85.7578,
+ "eval_samples_per_second": 16.034,
+ "eval_steps_per_second": 2.006,
+ "step": 2500
+ },
+ {
+ "entropy": 0.15765639198943973,
+ "epoch": 6.268991282689913,
+ "grad_norm": 0.47331130504608154,
+ "learning_rate": 8.324066858090663e-05,
+ "loss": 0.09571113586425781,
+ "mean_token_accuracy": 0.9683481335639954,
+ "num_tokens": 5884398.0,
+ "step": 2520
+ },
+ {
+ "epoch": 6.268991282689913,
+ "eval_entropy": 0.29231513846059176,
+ "eval_loss": 0.7392512559890747,
+ "eval_mean_token_accuracy": 0.8486633983462356,
+ "eval_num_tokens": 5884398.0,
+ "eval_runtime": 85.7846,
+ "eval_samples_per_second": 16.029,
+ "eval_steps_per_second": 2.005,
+ "step": 2520
+ },
+ {
+ "entropy": 0.16176860257983208,
+ "epoch": 6.318804483188045,
+ "grad_norm": 0.6142018437385559,
+ "learning_rate": 8.135028644470992e-05,
+ "loss": 0.09486144185066223,
+ "mean_token_accuracy": 0.9682316601276397,
+ "num_tokens": 5929876.0,
+ "step": 2540
+ },
+ {
+ "epoch": 6.318804483188045,
+ "eval_entropy": 0.2851274753379267,
+ "eval_loss": 0.7520816922187805,
+ "eval_mean_token_accuracy": 0.8501113649717597,
+ "eval_num_tokens": 5929876.0,
+ "eval_runtime": 85.9425,
+ "eval_samples_per_second": 15.999,
+ "eval_steps_per_second": 2.001,
+ "step": 2540
+ },
+ {
+ "entropy": 0.15404034564271568,
+ "epoch": 6.3686176836861765,
+ "grad_norm": 0.6051287651062012,
+ "learning_rate": 7.946949157063964e-05,
+ "loss": 0.09280472993850708,
+ "mean_token_accuracy": 0.9684635892510414,
+ "num_tokens": 5978490.0,
+ "step": 2560
+ },
+ {
+ "epoch": 6.3686176836861765,
+ "eval_entropy": 0.28802703563557114,
+ "eval_loss": 0.7439162135124207,
+ "eval_mean_token_accuracy": 0.8499851770872293,
+ "eval_num_tokens": 5978490.0,
+ "eval_runtime": 86.0703,
+ "eval_samples_per_second": 15.975,
+ "eval_steps_per_second": 1.998,
+ "step": 2560
+ },
+ {
+ "entropy": 0.15343588953837753,
+ "epoch": 6.418430884184309,
+ "grad_norm": 0.4823743402957916,
+ "learning_rate": 7.759885118077701e-05,
+ "loss": 0.09000591039657593,
+ "mean_token_accuracy": 0.9699928767979145,
+ "num_tokens": 6025380.0,
+ "step": 2580
+ },
+ {
+ "epoch": 6.418430884184309,
+ "eval_entropy": 0.2795634938533916,
+ "eval_loss": 0.7647850513458252,
+ "eval_mean_token_accuracy": 0.8503464397995971,
+ "eval_num_tokens": 6025380.0,
+ "eval_runtime": 85.8886,
+ "eval_samples_per_second": 16.009,
+ "eval_steps_per_second": 2.003,
+ "step": 2580
+ },
+ {
+ "entropy": 0.15740026142448188,
+ "epoch": 6.468244084682441,
+ "grad_norm": 0.5082696676254272,
+ "learning_rate": 7.57389294347494e-05,
+ "loss": 0.09191849827766418,
+ "mean_token_accuracy": 0.9692809768021107,
+ "num_tokens": 6073349.0,
+ "step": 2600
+ },
+ {
+ "epoch": 6.468244084682441,
+ "eval_entropy": 0.2913342311458532,
+ "eval_loss": 0.7518694996833801,
+ "eval_mean_token_accuracy": 0.8483168302580367,
+ "eval_num_tokens": 6073349.0,
+ "eval_runtime": 85.5761,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.01,
+ "step": 2600
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.56277747970902e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2620/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2620/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2620/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2620/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2620/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2620/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2620/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2620/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2620/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2620/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2620/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2620/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2620/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2620/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..25a79d2f9f81d19401c3519ad6a92c7ea2849aa4
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2620/trainer_state.json
@@ -0,0 +1,2785 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 6.518057285180573,
+ "eval_steps": 20,
+ "global_step": 2620,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ },
+ {
+ "entropy": 0.3193941755220294,
+ "epoch": 4.5280199252802,
+ "grad_norm": 0.8281906843185425,
+ "learning_rate": 0.0001509111761786888,
+ "loss": 0.23936262130737304,
+ "mean_token_accuracy": 0.9201708927750587,
+ "num_tokens": 4244423.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.5280199252802,
+ "eval_entropy": 0.38704028864239537,
+ "eval_loss": 0.6006569266319275,
+ "eval_mean_token_accuracy": 0.8502406720505205,
+ "eval_num_tokens": 4244423.0,
+ "eval_runtime": 86.8059,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1820
+ },
+ {
+ "entropy": 0.3164879363030195,
+ "epoch": 4.577833125778331,
+ "grad_norm": 0.7892968654632568,
+ "learning_rate": 0.00014905346557909867,
+ "loss": 0.24541733264923096,
+ "mean_token_accuracy": 0.9175932116806507,
+ "num_tokens": 4289773.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.577833125778331,
+ "eval_entropy": 0.38861122120951497,
+ "eval_loss": 0.6115967631340027,
+ "eval_mean_token_accuracy": 0.849471275196519,
+ "eval_num_tokens": 4289773.0,
+ "eval_runtime": 86.2946,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1840
+ },
+ {
+ "entropy": 0.3051785985007882,
+ "epoch": 4.627646326276463,
+ "grad_norm": 0.8109654188156128,
+ "learning_rate": 0.0001471849238862319,
+ "loss": 0.23433220386505127,
+ "mean_token_accuracy": 0.9206570319831371,
+ "num_tokens": 4336894.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.627646326276463,
+ "eval_entropy": 0.37162452295076015,
+ "eval_loss": 0.6184061765670776,
+ "eval_mean_token_accuracy": 0.8501173268223918,
+ "eval_num_tokens": 4336894.0,
+ "eval_runtime": 86.6865,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1860
+ },
+ {
+ "entropy": 0.3168198253959417,
+ "epoch": 4.677459526774595,
+ "grad_norm": 0.9512342214584351,
+ "learning_rate": 0.0001453061146267775,
+ "loss": 0.23832404613494873,
+ "mean_token_accuracy": 0.9197044663131237,
+ "num_tokens": 4382947.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.677459526774595,
+ "eval_entropy": 0.3845940856912801,
+ "eval_loss": 0.606762707233429,
+ "eval_mean_token_accuracy": 0.8504838194957999,
+ "eval_num_tokens": 4382947.0,
+ "eval_runtime": 86.5175,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 1880
+ },
+ {
+ "entropy": 0.30791807882487776,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 0.8123113512992859,
+ "learning_rate": 0.00014341760442398248,
+ "loss": 0.2395785331726074,
+ "mean_token_accuracy": 0.918928150832653,
+ "num_tokens": 4433050.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.7272727272727275,
+ "eval_entropy": 0.39762327222283494,
+ "eval_loss": 0.5994202494621277,
+ "eval_mean_token_accuracy": 0.8509274201337681,
+ "eval_num_tokens": 4433050.0,
+ "eval_runtime": 86.2873,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.993,
+ "step": 1900
+ },
+ {
+ "entropy": 0.3021434534341097,
+ "epoch": 4.777085927770859,
+ "grad_norm": 0.731787383556366,
+ "learning_rate": 0.000141519962826766,
+ "loss": 0.23494718074798585,
+ "mean_token_accuracy": 0.9201403826475143,
+ "num_tokens": 4483598.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.777085927770859,
+ "eval_entropy": 0.3827026732439219,
+ "eval_loss": 0.5995895862579346,
+ "eval_mean_token_accuracy": 0.851468373523202,
+ "eval_num_tokens": 4483598.0,
+ "eval_runtime": 86.3006,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 1920
+ },
+ {
+ "entropy": 0.31626159623265265,
+ "epoch": 4.826899128268991,
+ "grad_norm": 0.8848487138748169,
+ "learning_rate": 0.00013961376213795132,
+ "loss": 0.2439030647277832,
+ "mean_token_accuracy": 0.9196575872600079,
+ "num_tokens": 4529201.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.826899128268991,
+ "eval_entropy": 0.388698436839636,
+ "eval_loss": 0.6000174283981323,
+ "eval_mean_token_accuracy": 0.8518068187458571,
+ "eval_num_tokens": 4529201.0,
+ "eval_runtime": 86.8979,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.979,
+ "step": 1940
+ },
+ {
+ "entropy": 0.30520407035946845,
+ "epoch": 4.876712328767123,
+ "grad_norm": 0.8532460927963257,
+ "learning_rate": 0.00013769957724166695,
+ "loss": 0.23458616733551024,
+ "mean_token_accuracy": 0.9221912942826748,
+ "num_tokens": 4578167.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.876712328767123,
+ "eval_entropy": 0.38777847102908203,
+ "eval_loss": 0.6004981398582458,
+ "eval_mean_token_accuracy": 0.8516481768253238,
+ "eval_num_tokens": 4578167.0,
+ "eval_runtime": 87.0777,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.975,
+ "step": 1960
+ },
+ {
+ "entropy": 0.3226448342204094,
+ "epoch": 4.926525529265255,
+ "grad_norm": 0.6945561766624451,
+ "learning_rate": 0.0001357779854299694,
+ "loss": 0.24048397541046143,
+ "mean_token_accuracy": 0.9195300146937371,
+ "num_tokens": 4622316.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.926525529265255,
+ "eval_entropy": 0.38581624263247777,
+ "eval_loss": 0.6029234528541565,
+ "eval_mean_token_accuracy": 0.8514213260523108,
+ "eval_num_tokens": 4622316.0,
+ "eval_runtime": 85.8729,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 1980
+ },
+ {
+ "entropy": 0.3051655298098922,
+ "epoch": 4.976338729763388,
+ "grad_norm": 0.7976452708244324,
+ "learning_rate": 0.00013384956622874001,
+ "loss": 0.23584742546081544,
+ "mean_token_accuracy": 0.9216851457953453,
+ "num_tokens": 4670746.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.976338729763388,
+ "eval_entropy": 0.37913159246361533,
+ "eval_loss": 0.6057604551315308,
+ "eval_mean_token_accuracy": 0.8525801203971686,
+ "eval_num_tokens": 4670746.0,
+ "eval_runtime": 86.1145,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2000
+ },
+ {
+ "entropy": 0.27438195240803254,
+ "epoch": 5.024906600249066,
+ "grad_norm": 0.6729586124420166,
+ "learning_rate": 0.0001319149012229075,
+ "loss": 0.19775952100753785,
+ "mean_token_accuracy": 0.9339428559327737,
+ "num_tokens": 4716176.0,
+ "step": 2020
+ },
+ {
+ "epoch": 5.024906600249066,
+ "eval_entropy": 0.3448961910813354,
+ "eval_loss": 0.6750120520591736,
+ "eval_mean_token_accuracy": 0.8487970232963562,
+ "eval_num_tokens": 4716176.0,
+ "eval_runtime": 86.1169,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2020
+ },
+ {
+ "entropy": 0.21423916313797237,
+ "epoch": 5.074719800747198,
+ "grad_norm": 0.6934391856193542,
+ "learning_rate": 0.00012997457388105022,
+ "loss": 0.1439570426940918,
+ "mean_token_accuracy": 0.9528236843645572,
+ "num_tokens": 4763269.0,
+ "step": 2040
+ },
+ {
+ "epoch": 5.074719800747198,
+ "eval_entropy": 0.3570949243771475,
+ "eval_loss": 0.6465504169464111,
+ "eval_mean_token_accuracy": 0.8490785547467166,
+ "eval_num_tokens": 4763269.0,
+ "eval_runtime": 85.9574,
+ "eval_samples_per_second": 15.996,
+ "eval_steps_per_second": 2.001,
+ "step": 2040
+ },
+ {
+ "entropy": 0.20838565267622472,
+ "epoch": 5.12453300124533,
+ "grad_norm": 0.7286986112594604,
+ "learning_rate": 0.00012802916937942972,
+ "loss": 0.14467307329177856,
+ "mean_token_accuracy": 0.950994835793972,
+ "num_tokens": 4809047.0,
+ "step": 2060
+ },
+ {
+ "epoch": 5.12453300124533,
+ "eval_entropy": 0.3452463157821533,
+ "eval_loss": 0.6705958843231201,
+ "eval_mean_token_accuracy": 0.8490352796953778,
+ "eval_num_tokens": 4809047.0,
+ "eval_runtime": 86.228,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 2060
+ },
+ {
+ "entropy": 0.20453082229942082,
+ "epoch": 5.174346201743462,
+ "grad_norm": 0.7515555620193481,
+ "learning_rate": 0.00012607927442550974,
+ "loss": 0.13732000589370727,
+ "mean_token_accuracy": 0.9537357829511166,
+ "num_tokens": 4857965.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.174346201743462,
+ "eval_entropy": 0.32431264914745506,
+ "eval_loss": 0.6743043065071106,
+ "eval_mean_token_accuracy": 0.8504878629085629,
+ "eval_num_tokens": 4857965.0,
+ "eval_runtime": 86.5948,
+ "eval_samples_per_second": 15.879,
+ "eval_steps_per_second": 1.986,
+ "step": 2080
+ },
+ {
+ "entropy": 0.21812320686876774,
+ "epoch": 5.224159402241594,
+ "grad_norm": 0.9093465209007263,
+ "learning_rate": 0.0001241254770810132,
+ "loss": 0.14311420917510986,
+ "mean_token_accuracy": 0.9514068141579628,
+ "num_tokens": 4905151.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.224159402241594,
+ "eval_entropy": 0.33086285835435225,
+ "eval_loss": 0.6676449179649353,
+ "eval_mean_token_accuracy": 0.8505287662495015,
+ "eval_num_tokens": 4905151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 2100
+ },
+ {
+ "entropy": 0.2180163251236081,
+ "epoch": 5.273972602739726,
+ "grad_norm": 0.6703007221221924,
+ "learning_rate": 0.00012216836658457075,
+ "loss": 0.14803968667984008,
+ "mean_token_accuracy": 0.9521303348243236,
+ "num_tokens": 4947072.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.273972602739726,
+ "eval_entropy": 0.33162341708707255,
+ "eval_loss": 0.6658875942230225,
+ "eval_mean_token_accuracy": 0.8500757605530495,
+ "eval_num_tokens": 4947072.0,
+ "eval_runtime": 86.6296,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 2120
+ },
+ {
+ "entropy": 0.22511130161583423,
+ "epoch": 5.323785803237858,
+ "grad_norm": 0.8078880906105042,
+ "learning_rate": 0.00012020853317401455,
+ "loss": 0.15228408575057983,
+ "mean_token_accuracy": 0.947144789993763,
+ "num_tokens": 4991974.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.323785803237858,
+ "eval_entropy": 0.3354601170434508,
+ "eval_loss": 0.6677829623222351,
+ "eval_mean_token_accuracy": 0.8482600024273229,
+ "eval_num_tokens": 4991974.0,
+ "eval_runtime": 86.4689,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.989,
+ "step": 2140
+ },
+ {
+ "entropy": 0.2244176059961319,
+ "epoch": 5.37359900373599,
+ "grad_norm": 0.9636075496673584,
+ "learning_rate": 0.00011824656790837037,
+ "loss": 0.15260883569717407,
+ "mean_token_accuracy": 0.9471467643976211,
+ "num_tokens": 5038400.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.37359900373599,
+ "eval_entropy": 0.3381616926297199,
+ "eval_loss": 0.6694412231445312,
+ "eval_mean_token_accuracy": 0.8482369603805764,
+ "eval_num_tokens": 5038400.0,
+ "eval_runtime": 86.4147,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 2160
+ },
+ {
+ "entropy": 0.22982364390045404,
+ "epoch": 5.423412204234122,
+ "grad_norm": 0.775401771068573,
+ "learning_rate": 0.00011628306248960262,
+ "loss": 0.15140302181243898,
+ "mean_token_accuracy": 0.9492553934454918,
+ "num_tokens": 5083166.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.423412204234122,
+ "eval_entropy": 0.3305150235808173,
+ "eval_loss": 0.6717822551727295,
+ "eval_mean_token_accuracy": 0.8489849723355715,
+ "eval_num_tokens": 5083166.0,
+ "eval_runtime": 86.4728,
+ "eval_samples_per_second": 15.901,
+ "eval_steps_per_second": 1.989,
+ "step": 2180
+ },
+ {
+ "entropy": 0.21448935717344284,
+ "epoch": 5.473225404732254,
+ "grad_norm": 0.6575281023979187,
+ "learning_rate": 0.00011431860908416465,
+ "loss": 0.1452319622039795,
+ "mean_token_accuracy": 0.9505287684500218,
+ "num_tokens": 5135109.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.473225404732254,
+ "eval_entropy": 0.3488145174328671,
+ "eval_loss": 0.6612305641174316,
+ "eval_mean_token_accuracy": 0.8492907808963642,
+ "eval_num_tokens": 5135109.0,
+ "eval_runtime": 86.6927,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 2200
+ },
+ {
+ "entropy": 0.23091202937066554,
+ "epoch": 5.523038605230386,
+ "grad_norm": 0.8909686207771301,
+ "learning_rate": 0.00011235380014440985,
+ "loss": 0.15150139331817628,
+ "mean_token_accuracy": 0.9497875183820724,
+ "num_tokens": 5180138.0,
+ "step": 2220
+ },
+ {
+ "epoch": 5.523038605230386,
+ "eval_entropy": 0.3268539015810157,
+ "eval_loss": 0.6667542457580566,
+ "eval_mean_token_accuracy": 0.8499062903398691,
+ "eval_num_tokens": 5180138.0,
+ "eval_runtime": 86.4644,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 2220
+ },
+ {
+ "entropy": 0.2227974807843566,
+ "epoch": 5.572851805728518,
+ "grad_norm": 0.6180275082588196,
+ "learning_rate": 0.0001103892282299158,
+ "loss": 0.1491069197654724,
+ "mean_token_accuracy": 0.9488144010305405,
+ "num_tokens": 5226864.0,
+ "step": 2240
+ },
+ {
+ "epoch": 5.572851805728518,
+ "eval_entropy": 0.3346347655494546,
+ "eval_loss": 0.6665948629379272,
+ "eval_mean_token_accuracy": 0.8499961893918903,
+ "eval_num_tokens": 5226864.0,
+ "eval_runtime": 87.0548,
+ "eval_samples_per_second": 15.795,
+ "eval_steps_per_second": 1.976,
+ "step": 2240
+ },
+ {
+ "entropy": 0.21368421968072654,
+ "epoch": 5.62266500622665,
+ "grad_norm": 0.6004369258880615,
+ "learning_rate": 0.00010842548582877651,
+ "loss": 0.14485255479812623,
+ "mean_token_accuracy": 0.9502056457102299,
+ "num_tokens": 5276602.0,
+ "step": 2260
+ },
+ {
+ "epoch": 5.62266500622665,
+ "eval_entropy": 0.32753298804163933,
+ "eval_loss": 0.6680151224136353,
+ "eval_mean_token_accuracy": 0.8515451086121936,
+ "eval_num_tokens": 5276602.0,
+ "eval_runtime": 86.8524,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.98,
+ "step": 2260
+ },
+ {
+ "entropy": 0.2103635374456644,
+ "epoch": 5.672478206724782,
+ "grad_norm": 0.699174702167511,
+ "learning_rate": 0.00010646316517891613,
+ "loss": 0.14297772645950318,
+ "mean_token_accuracy": 0.9512537539005279,
+ "num_tokens": 5323718.0,
+ "step": 2280
+ },
+ {
+ "epoch": 5.672478206724782,
+ "eval_entropy": 0.32966585959806,
+ "eval_loss": 0.675578773021698,
+ "eval_mean_token_accuracy": 0.8509623023659684,
+ "eval_num_tokens": 5323718.0,
+ "eval_runtime": 86.4518,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2280
+ },
+ {
+ "entropy": 0.22516900151968003,
+ "epoch": 5.722291407222914,
+ "grad_norm": 0.6637354493141174,
+ "learning_rate": 0.00010450285808947797,
+ "loss": 0.15202572345733642,
+ "mean_token_accuracy": 0.9482452072203159,
+ "num_tokens": 5369039.0,
+ "step": 2300
+ },
+ {
+ "epoch": 5.722291407222914,
+ "eval_entropy": 0.3369456917740578,
+ "eval_loss": 0.6697061061859131,
+ "eval_mean_token_accuracy": 0.848603522361711,
+ "eval_num_tokens": 5369039.0,
+ "eval_runtime": 86.6371,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.985,
+ "step": 2300
+ },
+ {
+ "entropy": 0.21841065725311637,
+ "epoch": 5.772104607721046,
+ "grad_norm": 0.7940268516540527,
+ "learning_rate": 0.00010254515576234297,
+ "loss": 0.14710167646408082,
+ "mean_token_accuracy": 0.9493498183786869,
+ "num_tokens": 5417029.0,
+ "step": 2320
+ },
+ {
+ "epoch": 5.772104607721046,
+ "eval_entropy": 0.3237486180177955,
+ "eval_loss": 0.6779657602310181,
+ "eval_mean_token_accuracy": 0.8500715313955794,
+ "eval_num_tokens": 5417029.0,
+ "eval_runtime": 86.1826,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 1.996,
+ "step": 2320
+ },
+ {
+ "entropy": 0.22146204356104135,
+ "epoch": 5.821917808219178,
+ "grad_norm": 0.9234833121299744,
+ "learning_rate": 0.00010059064861383132,
+ "loss": 0.14720046520233154,
+ "mean_token_accuracy": 0.9493872679769992,
+ "num_tokens": 5461671.0,
+ "step": 2340
+ },
+ {
+ "epoch": 5.821917808219178,
+ "eval_entropy": 0.32365207564692167,
+ "eval_loss": 0.6704005002975464,
+ "eval_mean_token_accuracy": 0.8507985760306203,
+ "eval_num_tokens": 5461671.0,
+ "eval_runtime": 86.5494,
+ "eval_samples_per_second": 15.887,
+ "eval_steps_per_second": 1.987,
+ "step": 2340
+ },
+ {
+ "entropy": 0.20934011954814197,
+ "epoch": 5.87173100871731,
+ "grad_norm": 0.5547503232955933,
+ "learning_rate": 9.863992609664084e-05,
+ "loss": 0.1464867353439331,
+ "mean_token_accuracy": 0.9503875687718392,
+ "num_tokens": 5509312.0,
+ "step": 2360
+ },
+ {
+ "epoch": 5.87173100871731,
+ "eval_entropy": 0.3330401429083458,
+ "eval_loss": 0.6659091114997864,
+ "eval_mean_token_accuracy": 0.8504848906467127,
+ "eval_num_tokens": 5509312.0,
+ "eval_runtime": 86.5855,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 2360
+ },
+ {
+ "entropy": 0.21678635366261007,
+ "epoch": 5.921544209215442,
+ "grad_norm": 0.570612907409668,
+ "learning_rate": 9.669357652207635e-05,
+ "loss": 0.14821385145187377,
+ "mean_token_accuracy": 0.9503940217196941,
+ "num_tokens": 5558196.0,
+ "step": 2380
+ },
+ {
+ "epoch": 5.921544209215442,
+ "eval_entropy": 0.3322022325077722,
+ "eval_loss": 0.6722489595413208,
+ "eval_mean_token_accuracy": 0.8489979422369669,
+ "eval_num_tokens": 5558196.0,
+ "eval_runtime": 86.2986,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 2380
+ },
+ {
+ "entropy": 0.20932920072227718,
+ "epoch": 5.971357409713574,
+ "grad_norm": 0.7879557609558105,
+ "learning_rate": 9.475218688262262e-05,
+ "loss": 0.14675841331481934,
+ "mean_token_accuracy": 0.9507176131010056,
+ "num_tokens": 5605400.0,
+ "step": 2400
+ },
+ {
+ "epoch": 5.971357409713574,
+ "eval_entropy": 0.3199348642902319,
+ "eval_loss": 0.6698136329650879,
+ "eval_mean_token_accuracy": 0.8514142130003419,
+ "eval_num_tokens": 5605400.0,
+ "eval_runtime": 85.8995,
+ "eval_samples_per_second": 16.007,
+ "eval_steps_per_second": 2.002,
+ "step": 2400
+ },
+ {
+ "entropy": 0.21032143919131693,
+ "epoch": 6.019925280199253,
+ "grad_norm": 0.5823076367378235,
+ "learning_rate": 9.281634267491569e-05,
+ "loss": 0.13322267532348633,
+ "mean_token_accuracy": 0.9550939072401096,
+ "num_tokens": 5648968.0,
+ "step": 2420
+ },
+ {
+ "epoch": 6.019925280199253,
+ "eval_entropy": 0.30206270117399303,
+ "eval_loss": 0.7093168497085571,
+ "eval_mean_token_accuracy": 0.8500627639681794,
+ "eval_num_tokens": 5648968.0,
+ "eval_runtime": 85.8128,
+ "eval_samples_per_second": 16.023,
+ "eval_steps_per_second": 2.004,
+ "step": 2420
+ },
+ {
+ "entropy": 0.1534628233872354,
+ "epoch": 6.069738480697385,
+ "grad_norm": 0.710133969783783,
+ "learning_rate": 9.088662772316508e-05,
+ "loss": 0.09078952670097351,
+ "mean_token_accuracy": 0.9678447999060154,
+ "num_tokens": 5697633.0,
+ "step": 2440
+ },
+ {
+ "epoch": 6.069738480697385,
+ "eval_entropy": 0.28208133101809857,
+ "eval_loss": 0.7636417150497437,
+ "eval_mean_token_accuracy": 0.8494061477655588,
+ "eval_num_tokens": 5697633.0,
+ "eval_runtime": 85.9724,
+ "eval_samples_per_second": 15.994,
+ "eval_steps_per_second": 2.001,
+ "step": 2440
+ },
+ {
+ "entropy": 0.16151462448760867,
+ "epoch": 6.119551681195516,
+ "grad_norm": 0.5793812274932861,
+ "learning_rate": 8.896362400308028e-05,
+ "loss": 0.09545697569847107,
+ "mean_token_accuracy": 0.9671573750674725,
+ "num_tokens": 5745090.0,
+ "step": 2460
+ },
+ {
+ "epoch": 6.119551681195516,
+ "eval_entropy": 0.2833245605403601,
+ "eval_loss": 0.7402405738830566,
+ "eval_mean_token_accuracy": 0.8503523728875226,
+ "eval_num_tokens": 5745090.0,
+ "eval_runtime": 85.5461,
+ "eval_samples_per_second": 16.073,
+ "eval_steps_per_second": 2.011,
+ "step": 2460
+ },
+ {
+ "entropy": 0.15203177919611335,
+ "epoch": 6.169364881693649,
+ "grad_norm": 0.4251123368740082,
+ "learning_rate": 8.704791146635483e-05,
+ "loss": 0.09420782327651978,
+ "mean_token_accuracy": 0.9677386932075024,
+ "num_tokens": 5790333.0,
+ "step": 2480
+ },
+ {
+ "epoch": 6.169364881693649,
+ "eval_entropy": 0.28572545962971313,
+ "eval_loss": 0.735416829586029,
+ "eval_mean_token_accuracy": 0.8487084663884584,
+ "eval_num_tokens": 5790333.0,
+ "eval_runtime": 85.4801,
+ "eval_samples_per_second": 16.086,
+ "eval_steps_per_second": 2.012,
+ "step": 2480
+ },
+ {
+ "entropy": 0.15587336672469973,
+ "epoch": 6.219178082191781,
+ "grad_norm": 0.4357028007507324,
+ "learning_rate": 8.514006786576085e-05,
+ "loss": 0.09429320096969604,
+ "mean_token_accuracy": 0.9682952925562859,
+ "num_tokens": 5837321.0,
+ "step": 2500
+ },
+ {
+ "epoch": 6.219178082191781,
+ "eval_entropy": 0.2859006894882335,
+ "eval_loss": 0.7347224950790405,
+ "eval_mean_token_accuracy": 0.8501905518215757,
+ "eval_num_tokens": 5837321.0,
+ "eval_runtime": 85.7578,
+ "eval_samples_per_second": 16.034,
+ "eval_steps_per_second": 2.006,
+ "step": 2500
+ },
+ {
+ "entropy": 0.15765639198943973,
+ "epoch": 6.268991282689913,
+ "grad_norm": 0.47331130504608154,
+ "learning_rate": 8.324066858090663e-05,
+ "loss": 0.09571113586425781,
+ "mean_token_accuracy": 0.9683481335639954,
+ "num_tokens": 5884398.0,
+ "step": 2520
+ },
+ {
+ "epoch": 6.268991282689913,
+ "eval_entropy": 0.29231513846059176,
+ "eval_loss": 0.7392512559890747,
+ "eval_mean_token_accuracy": 0.8486633983462356,
+ "eval_num_tokens": 5884398.0,
+ "eval_runtime": 85.7846,
+ "eval_samples_per_second": 16.029,
+ "eval_steps_per_second": 2.005,
+ "step": 2520
+ },
+ {
+ "entropy": 0.16176860257983208,
+ "epoch": 6.318804483188045,
+ "grad_norm": 0.6142018437385559,
+ "learning_rate": 8.135028644470992e-05,
+ "loss": 0.09486144185066223,
+ "mean_token_accuracy": 0.9682316601276397,
+ "num_tokens": 5929876.0,
+ "step": 2540
+ },
+ {
+ "epoch": 6.318804483188045,
+ "eval_entropy": 0.2851274753379267,
+ "eval_loss": 0.7520816922187805,
+ "eval_mean_token_accuracy": 0.8501113649717597,
+ "eval_num_tokens": 5929876.0,
+ "eval_runtime": 85.9425,
+ "eval_samples_per_second": 15.999,
+ "eval_steps_per_second": 2.001,
+ "step": 2540
+ },
+ {
+ "entropy": 0.15404034564271568,
+ "epoch": 6.3686176836861765,
+ "grad_norm": 0.6051287651062012,
+ "learning_rate": 7.946949157063964e-05,
+ "loss": 0.09280472993850708,
+ "mean_token_accuracy": 0.9684635892510414,
+ "num_tokens": 5978490.0,
+ "step": 2560
+ },
+ {
+ "epoch": 6.3686176836861765,
+ "eval_entropy": 0.28802703563557114,
+ "eval_loss": 0.7439162135124207,
+ "eval_mean_token_accuracy": 0.8499851770872293,
+ "eval_num_tokens": 5978490.0,
+ "eval_runtime": 86.0703,
+ "eval_samples_per_second": 15.975,
+ "eval_steps_per_second": 1.998,
+ "step": 2560
+ },
+ {
+ "entropy": 0.15343588953837753,
+ "epoch": 6.418430884184309,
+ "grad_norm": 0.4823743402957916,
+ "learning_rate": 7.759885118077701e-05,
+ "loss": 0.09000591039657593,
+ "mean_token_accuracy": 0.9699928767979145,
+ "num_tokens": 6025380.0,
+ "step": 2580
+ },
+ {
+ "epoch": 6.418430884184309,
+ "eval_entropy": 0.2795634938533916,
+ "eval_loss": 0.7647850513458252,
+ "eval_mean_token_accuracy": 0.8503464397995971,
+ "eval_num_tokens": 6025380.0,
+ "eval_runtime": 85.8886,
+ "eval_samples_per_second": 16.009,
+ "eval_steps_per_second": 2.003,
+ "step": 2580
+ },
+ {
+ "entropy": 0.15740026142448188,
+ "epoch": 6.468244084682441,
+ "grad_norm": 0.5082696676254272,
+ "learning_rate": 7.57389294347494e-05,
+ "loss": 0.09191849827766418,
+ "mean_token_accuracy": 0.9692809768021107,
+ "num_tokens": 6073349.0,
+ "step": 2600
+ },
+ {
+ "epoch": 6.468244084682441,
+ "eval_entropy": 0.2913342311458532,
+ "eval_loss": 0.7518694996833801,
+ "eval_mean_token_accuracy": 0.8483168302580367,
+ "eval_num_tokens": 6073349.0,
+ "eval_runtime": 85.5761,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.01,
+ "step": 2600
+ },
+ {
+ "entropy": 0.15922069251537324,
+ "epoch": 6.518057285180573,
+ "grad_norm": 0.3995199501514435,
+ "learning_rate": 7.389028725958736e-05,
+ "loss": 0.09584367871284485,
+ "mean_token_accuracy": 0.9685114495456218,
+ "num_tokens": 6118148.0,
+ "step": 2620
+ },
+ {
+ "epoch": 6.518057285180573,
+ "eval_entropy": 0.2863075934177221,
+ "eval_loss": 0.7539381384849548,
+ "eval_mean_token_accuracy": 0.8507507083027862,
+ "eval_num_tokens": 6118148.0,
+ "eval_runtime": 86.112,
+ "eval_samples_per_second": 15.968,
+ "eval_steps_per_second": 1.997,
+ "step": 2620
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.5808583541512806e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2640/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2640/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2640/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2640/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2640/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2640/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2640/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2640/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2640/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2640/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2640/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2640/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2640/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2640/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..93b0fe8ed2233fb54543590a29e878c3480f2261
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2640/trainer_state.json
@@ -0,0 +1,2806 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 6.567870485678705,
+ "eval_steps": 20,
+ "global_step": 2640,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ },
+ {
+ "entropy": 0.3193941755220294,
+ "epoch": 4.5280199252802,
+ "grad_norm": 0.8281906843185425,
+ "learning_rate": 0.0001509111761786888,
+ "loss": 0.23936262130737304,
+ "mean_token_accuracy": 0.9201708927750587,
+ "num_tokens": 4244423.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.5280199252802,
+ "eval_entropy": 0.38704028864239537,
+ "eval_loss": 0.6006569266319275,
+ "eval_mean_token_accuracy": 0.8502406720505205,
+ "eval_num_tokens": 4244423.0,
+ "eval_runtime": 86.8059,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1820
+ },
+ {
+ "entropy": 0.3164879363030195,
+ "epoch": 4.577833125778331,
+ "grad_norm": 0.7892968654632568,
+ "learning_rate": 0.00014905346557909867,
+ "loss": 0.24541733264923096,
+ "mean_token_accuracy": 0.9175932116806507,
+ "num_tokens": 4289773.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.577833125778331,
+ "eval_entropy": 0.38861122120951497,
+ "eval_loss": 0.6115967631340027,
+ "eval_mean_token_accuracy": 0.849471275196519,
+ "eval_num_tokens": 4289773.0,
+ "eval_runtime": 86.2946,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1840
+ },
+ {
+ "entropy": 0.3051785985007882,
+ "epoch": 4.627646326276463,
+ "grad_norm": 0.8109654188156128,
+ "learning_rate": 0.0001471849238862319,
+ "loss": 0.23433220386505127,
+ "mean_token_accuracy": 0.9206570319831371,
+ "num_tokens": 4336894.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.627646326276463,
+ "eval_entropy": 0.37162452295076015,
+ "eval_loss": 0.6184061765670776,
+ "eval_mean_token_accuracy": 0.8501173268223918,
+ "eval_num_tokens": 4336894.0,
+ "eval_runtime": 86.6865,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1860
+ },
+ {
+ "entropy": 0.3168198253959417,
+ "epoch": 4.677459526774595,
+ "grad_norm": 0.9512342214584351,
+ "learning_rate": 0.0001453061146267775,
+ "loss": 0.23832404613494873,
+ "mean_token_accuracy": 0.9197044663131237,
+ "num_tokens": 4382947.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.677459526774595,
+ "eval_entropy": 0.3845940856912801,
+ "eval_loss": 0.606762707233429,
+ "eval_mean_token_accuracy": 0.8504838194957999,
+ "eval_num_tokens": 4382947.0,
+ "eval_runtime": 86.5175,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 1880
+ },
+ {
+ "entropy": 0.30791807882487776,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 0.8123113512992859,
+ "learning_rate": 0.00014341760442398248,
+ "loss": 0.2395785331726074,
+ "mean_token_accuracy": 0.918928150832653,
+ "num_tokens": 4433050.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.7272727272727275,
+ "eval_entropy": 0.39762327222283494,
+ "eval_loss": 0.5994202494621277,
+ "eval_mean_token_accuracy": 0.8509274201337681,
+ "eval_num_tokens": 4433050.0,
+ "eval_runtime": 86.2873,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.993,
+ "step": 1900
+ },
+ {
+ "entropy": 0.3021434534341097,
+ "epoch": 4.777085927770859,
+ "grad_norm": 0.731787383556366,
+ "learning_rate": 0.000141519962826766,
+ "loss": 0.23494718074798585,
+ "mean_token_accuracy": 0.9201403826475143,
+ "num_tokens": 4483598.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.777085927770859,
+ "eval_entropy": 0.3827026732439219,
+ "eval_loss": 0.5995895862579346,
+ "eval_mean_token_accuracy": 0.851468373523202,
+ "eval_num_tokens": 4483598.0,
+ "eval_runtime": 86.3006,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 1920
+ },
+ {
+ "entropy": 0.31626159623265265,
+ "epoch": 4.826899128268991,
+ "grad_norm": 0.8848487138748169,
+ "learning_rate": 0.00013961376213795132,
+ "loss": 0.2439030647277832,
+ "mean_token_accuracy": 0.9196575872600079,
+ "num_tokens": 4529201.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.826899128268991,
+ "eval_entropy": 0.388698436839636,
+ "eval_loss": 0.6000174283981323,
+ "eval_mean_token_accuracy": 0.8518068187458571,
+ "eval_num_tokens": 4529201.0,
+ "eval_runtime": 86.8979,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.979,
+ "step": 1940
+ },
+ {
+ "entropy": 0.30520407035946845,
+ "epoch": 4.876712328767123,
+ "grad_norm": 0.8532460927963257,
+ "learning_rate": 0.00013769957724166695,
+ "loss": 0.23458616733551024,
+ "mean_token_accuracy": 0.9221912942826748,
+ "num_tokens": 4578167.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.876712328767123,
+ "eval_entropy": 0.38777847102908203,
+ "eval_loss": 0.6004981398582458,
+ "eval_mean_token_accuracy": 0.8516481768253238,
+ "eval_num_tokens": 4578167.0,
+ "eval_runtime": 87.0777,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.975,
+ "step": 1960
+ },
+ {
+ "entropy": 0.3226448342204094,
+ "epoch": 4.926525529265255,
+ "grad_norm": 0.6945561766624451,
+ "learning_rate": 0.0001357779854299694,
+ "loss": 0.24048397541046143,
+ "mean_token_accuracy": 0.9195300146937371,
+ "num_tokens": 4622316.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.926525529265255,
+ "eval_entropy": 0.38581624263247777,
+ "eval_loss": 0.6029234528541565,
+ "eval_mean_token_accuracy": 0.8514213260523108,
+ "eval_num_tokens": 4622316.0,
+ "eval_runtime": 85.8729,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 1980
+ },
+ {
+ "entropy": 0.3051655298098922,
+ "epoch": 4.976338729763388,
+ "grad_norm": 0.7976452708244324,
+ "learning_rate": 0.00013384956622874001,
+ "loss": 0.23584742546081544,
+ "mean_token_accuracy": 0.9216851457953453,
+ "num_tokens": 4670746.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.976338729763388,
+ "eval_entropy": 0.37913159246361533,
+ "eval_loss": 0.6057604551315308,
+ "eval_mean_token_accuracy": 0.8525801203971686,
+ "eval_num_tokens": 4670746.0,
+ "eval_runtime": 86.1145,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2000
+ },
+ {
+ "entropy": 0.27438195240803254,
+ "epoch": 5.024906600249066,
+ "grad_norm": 0.6729586124420166,
+ "learning_rate": 0.0001319149012229075,
+ "loss": 0.19775952100753785,
+ "mean_token_accuracy": 0.9339428559327737,
+ "num_tokens": 4716176.0,
+ "step": 2020
+ },
+ {
+ "epoch": 5.024906600249066,
+ "eval_entropy": 0.3448961910813354,
+ "eval_loss": 0.6750120520591736,
+ "eval_mean_token_accuracy": 0.8487970232963562,
+ "eval_num_tokens": 4716176.0,
+ "eval_runtime": 86.1169,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2020
+ },
+ {
+ "entropy": 0.21423916313797237,
+ "epoch": 5.074719800747198,
+ "grad_norm": 0.6934391856193542,
+ "learning_rate": 0.00012997457388105022,
+ "loss": 0.1439570426940918,
+ "mean_token_accuracy": 0.9528236843645572,
+ "num_tokens": 4763269.0,
+ "step": 2040
+ },
+ {
+ "epoch": 5.074719800747198,
+ "eval_entropy": 0.3570949243771475,
+ "eval_loss": 0.6465504169464111,
+ "eval_mean_token_accuracy": 0.8490785547467166,
+ "eval_num_tokens": 4763269.0,
+ "eval_runtime": 85.9574,
+ "eval_samples_per_second": 15.996,
+ "eval_steps_per_second": 2.001,
+ "step": 2040
+ },
+ {
+ "entropy": 0.20838565267622472,
+ "epoch": 5.12453300124533,
+ "grad_norm": 0.7286986112594604,
+ "learning_rate": 0.00012802916937942972,
+ "loss": 0.14467307329177856,
+ "mean_token_accuracy": 0.950994835793972,
+ "num_tokens": 4809047.0,
+ "step": 2060
+ },
+ {
+ "epoch": 5.12453300124533,
+ "eval_entropy": 0.3452463157821533,
+ "eval_loss": 0.6705958843231201,
+ "eval_mean_token_accuracy": 0.8490352796953778,
+ "eval_num_tokens": 4809047.0,
+ "eval_runtime": 86.228,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 2060
+ },
+ {
+ "entropy": 0.20453082229942082,
+ "epoch": 5.174346201743462,
+ "grad_norm": 0.7515555620193481,
+ "learning_rate": 0.00012607927442550974,
+ "loss": 0.13732000589370727,
+ "mean_token_accuracy": 0.9537357829511166,
+ "num_tokens": 4857965.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.174346201743462,
+ "eval_entropy": 0.32431264914745506,
+ "eval_loss": 0.6743043065071106,
+ "eval_mean_token_accuracy": 0.8504878629085629,
+ "eval_num_tokens": 4857965.0,
+ "eval_runtime": 86.5948,
+ "eval_samples_per_second": 15.879,
+ "eval_steps_per_second": 1.986,
+ "step": 2080
+ },
+ {
+ "entropy": 0.21812320686876774,
+ "epoch": 5.224159402241594,
+ "grad_norm": 0.9093465209007263,
+ "learning_rate": 0.0001241254770810132,
+ "loss": 0.14311420917510986,
+ "mean_token_accuracy": 0.9514068141579628,
+ "num_tokens": 4905151.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.224159402241594,
+ "eval_entropy": 0.33086285835435225,
+ "eval_loss": 0.6676449179649353,
+ "eval_mean_token_accuracy": 0.8505287662495015,
+ "eval_num_tokens": 4905151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 2100
+ },
+ {
+ "entropy": 0.2180163251236081,
+ "epoch": 5.273972602739726,
+ "grad_norm": 0.6703007221221924,
+ "learning_rate": 0.00012216836658457075,
+ "loss": 0.14803968667984008,
+ "mean_token_accuracy": 0.9521303348243236,
+ "num_tokens": 4947072.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.273972602739726,
+ "eval_entropy": 0.33162341708707255,
+ "eval_loss": 0.6658875942230225,
+ "eval_mean_token_accuracy": 0.8500757605530495,
+ "eval_num_tokens": 4947072.0,
+ "eval_runtime": 86.6296,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 2120
+ },
+ {
+ "entropy": 0.22511130161583423,
+ "epoch": 5.323785803237858,
+ "grad_norm": 0.8078880906105042,
+ "learning_rate": 0.00012020853317401455,
+ "loss": 0.15228408575057983,
+ "mean_token_accuracy": 0.947144789993763,
+ "num_tokens": 4991974.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.323785803237858,
+ "eval_entropy": 0.3354601170434508,
+ "eval_loss": 0.6677829623222351,
+ "eval_mean_token_accuracy": 0.8482600024273229,
+ "eval_num_tokens": 4991974.0,
+ "eval_runtime": 86.4689,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.989,
+ "step": 2140
+ },
+ {
+ "entropy": 0.2244176059961319,
+ "epoch": 5.37359900373599,
+ "grad_norm": 0.9636075496673584,
+ "learning_rate": 0.00011824656790837037,
+ "loss": 0.15260883569717407,
+ "mean_token_accuracy": 0.9471467643976211,
+ "num_tokens": 5038400.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.37359900373599,
+ "eval_entropy": 0.3381616926297199,
+ "eval_loss": 0.6694412231445312,
+ "eval_mean_token_accuracy": 0.8482369603805764,
+ "eval_num_tokens": 5038400.0,
+ "eval_runtime": 86.4147,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 2160
+ },
+ {
+ "entropy": 0.22982364390045404,
+ "epoch": 5.423412204234122,
+ "grad_norm": 0.775401771068573,
+ "learning_rate": 0.00011628306248960262,
+ "loss": 0.15140302181243898,
+ "mean_token_accuracy": 0.9492553934454918,
+ "num_tokens": 5083166.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.423412204234122,
+ "eval_entropy": 0.3305150235808173,
+ "eval_loss": 0.6717822551727295,
+ "eval_mean_token_accuracy": 0.8489849723355715,
+ "eval_num_tokens": 5083166.0,
+ "eval_runtime": 86.4728,
+ "eval_samples_per_second": 15.901,
+ "eval_steps_per_second": 1.989,
+ "step": 2180
+ },
+ {
+ "entropy": 0.21448935717344284,
+ "epoch": 5.473225404732254,
+ "grad_norm": 0.6575281023979187,
+ "learning_rate": 0.00011431860908416465,
+ "loss": 0.1452319622039795,
+ "mean_token_accuracy": 0.9505287684500218,
+ "num_tokens": 5135109.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.473225404732254,
+ "eval_entropy": 0.3488145174328671,
+ "eval_loss": 0.6612305641174316,
+ "eval_mean_token_accuracy": 0.8492907808963642,
+ "eval_num_tokens": 5135109.0,
+ "eval_runtime": 86.6927,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 2200
+ },
+ {
+ "entropy": 0.23091202937066554,
+ "epoch": 5.523038605230386,
+ "grad_norm": 0.8909686207771301,
+ "learning_rate": 0.00011235380014440985,
+ "loss": 0.15150139331817628,
+ "mean_token_accuracy": 0.9497875183820724,
+ "num_tokens": 5180138.0,
+ "step": 2220
+ },
+ {
+ "epoch": 5.523038605230386,
+ "eval_entropy": 0.3268539015810157,
+ "eval_loss": 0.6667542457580566,
+ "eval_mean_token_accuracy": 0.8499062903398691,
+ "eval_num_tokens": 5180138.0,
+ "eval_runtime": 86.4644,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 2220
+ },
+ {
+ "entropy": 0.2227974807843566,
+ "epoch": 5.572851805728518,
+ "grad_norm": 0.6180275082588196,
+ "learning_rate": 0.0001103892282299158,
+ "loss": 0.1491069197654724,
+ "mean_token_accuracy": 0.9488144010305405,
+ "num_tokens": 5226864.0,
+ "step": 2240
+ },
+ {
+ "epoch": 5.572851805728518,
+ "eval_entropy": 0.3346347655494546,
+ "eval_loss": 0.6665948629379272,
+ "eval_mean_token_accuracy": 0.8499961893918903,
+ "eval_num_tokens": 5226864.0,
+ "eval_runtime": 87.0548,
+ "eval_samples_per_second": 15.795,
+ "eval_steps_per_second": 1.976,
+ "step": 2240
+ },
+ {
+ "entropy": 0.21368421968072654,
+ "epoch": 5.62266500622665,
+ "grad_norm": 0.6004369258880615,
+ "learning_rate": 0.00010842548582877651,
+ "loss": 0.14485255479812623,
+ "mean_token_accuracy": 0.9502056457102299,
+ "num_tokens": 5276602.0,
+ "step": 2260
+ },
+ {
+ "epoch": 5.62266500622665,
+ "eval_entropy": 0.32753298804163933,
+ "eval_loss": 0.6680151224136353,
+ "eval_mean_token_accuracy": 0.8515451086121936,
+ "eval_num_tokens": 5276602.0,
+ "eval_runtime": 86.8524,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.98,
+ "step": 2260
+ },
+ {
+ "entropy": 0.2103635374456644,
+ "epoch": 5.672478206724782,
+ "grad_norm": 0.699174702167511,
+ "learning_rate": 0.00010646316517891613,
+ "loss": 0.14297772645950318,
+ "mean_token_accuracy": 0.9512537539005279,
+ "num_tokens": 5323718.0,
+ "step": 2280
+ },
+ {
+ "epoch": 5.672478206724782,
+ "eval_entropy": 0.32966585959806,
+ "eval_loss": 0.675578773021698,
+ "eval_mean_token_accuracy": 0.8509623023659684,
+ "eval_num_tokens": 5323718.0,
+ "eval_runtime": 86.4518,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2280
+ },
+ {
+ "entropy": 0.22516900151968003,
+ "epoch": 5.722291407222914,
+ "grad_norm": 0.6637354493141174,
+ "learning_rate": 0.00010450285808947797,
+ "loss": 0.15202572345733642,
+ "mean_token_accuracy": 0.9482452072203159,
+ "num_tokens": 5369039.0,
+ "step": 2300
+ },
+ {
+ "epoch": 5.722291407222914,
+ "eval_entropy": 0.3369456917740578,
+ "eval_loss": 0.6697061061859131,
+ "eval_mean_token_accuracy": 0.848603522361711,
+ "eval_num_tokens": 5369039.0,
+ "eval_runtime": 86.6371,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.985,
+ "step": 2300
+ },
+ {
+ "entropy": 0.21841065725311637,
+ "epoch": 5.772104607721046,
+ "grad_norm": 0.7940268516540527,
+ "learning_rate": 0.00010254515576234297,
+ "loss": 0.14710167646408082,
+ "mean_token_accuracy": 0.9493498183786869,
+ "num_tokens": 5417029.0,
+ "step": 2320
+ },
+ {
+ "epoch": 5.772104607721046,
+ "eval_entropy": 0.3237486180177955,
+ "eval_loss": 0.6779657602310181,
+ "eval_mean_token_accuracy": 0.8500715313955794,
+ "eval_num_tokens": 5417029.0,
+ "eval_runtime": 86.1826,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 1.996,
+ "step": 2320
+ },
+ {
+ "entropy": 0.22146204356104135,
+ "epoch": 5.821917808219178,
+ "grad_norm": 0.9234833121299744,
+ "learning_rate": 0.00010059064861383132,
+ "loss": 0.14720046520233154,
+ "mean_token_accuracy": 0.9493872679769992,
+ "num_tokens": 5461671.0,
+ "step": 2340
+ },
+ {
+ "epoch": 5.821917808219178,
+ "eval_entropy": 0.32365207564692167,
+ "eval_loss": 0.6704005002975464,
+ "eval_mean_token_accuracy": 0.8507985760306203,
+ "eval_num_tokens": 5461671.0,
+ "eval_runtime": 86.5494,
+ "eval_samples_per_second": 15.887,
+ "eval_steps_per_second": 1.987,
+ "step": 2340
+ },
+ {
+ "entropy": 0.20934011954814197,
+ "epoch": 5.87173100871731,
+ "grad_norm": 0.5547503232955933,
+ "learning_rate": 9.863992609664084e-05,
+ "loss": 0.1464867353439331,
+ "mean_token_accuracy": 0.9503875687718392,
+ "num_tokens": 5509312.0,
+ "step": 2360
+ },
+ {
+ "epoch": 5.87173100871731,
+ "eval_entropy": 0.3330401429083458,
+ "eval_loss": 0.6659091114997864,
+ "eval_mean_token_accuracy": 0.8504848906467127,
+ "eval_num_tokens": 5509312.0,
+ "eval_runtime": 86.5855,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 2360
+ },
+ {
+ "entropy": 0.21678635366261007,
+ "epoch": 5.921544209215442,
+ "grad_norm": 0.570612907409668,
+ "learning_rate": 9.669357652207635e-05,
+ "loss": 0.14821385145187377,
+ "mean_token_accuracy": 0.9503940217196941,
+ "num_tokens": 5558196.0,
+ "step": 2380
+ },
+ {
+ "epoch": 5.921544209215442,
+ "eval_entropy": 0.3322022325077722,
+ "eval_loss": 0.6722489595413208,
+ "eval_mean_token_accuracy": 0.8489979422369669,
+ "eval_num_tokens": 5558196.0,
+ "eval_runtime": 86.2986,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 2380
+ },
+ {
+ "entropy": 0.20932920072227718,
+ "epoch": 5.971357409713574,
+ "grad_norm": 0.7879557609558105,
+ "learning_rate": 9.475218688262262e-05,
+ "loss": 0.14675841331481934,
+ "mean_token_accuracy": 0.9507176131010056,
+ "num_tokens": 5605400.0,
+ "step": 2400
+ },
+ {
+ "epoch": 5.971357409713574,
+ "eval_entropy": 0.3199348642902319,
+ "eval_loss": 0.6698136329650879,
+ "eval_mean_token_accuracy": 0.8514142130003419,
+ "eval_num_tokens": 5605400.0,
+ "eval_runtime": 85.8995,
+ "eval_samples_per_second": 16.007,
+ "eval_steps_per_second": 2.002,
+ "step": 2400
+ },
+ {
+ "entropy": 0.21032143919131693,
+ "epoch": 6.019925280199253,
+ "grad_norm": 0.5823076367378235,
+ "learning_rate": 9.281634267491569e-05,
+ "loss": 0.13322267532348633,
+ "mean_token_accuracy": 0.9550939072401096,
+ "num_tokens": 5648968.0,
+ "step": 2420
+ },
+ {
+ "epoch": 6.019925280199253,
+ "eval_entropy": 0.30206270117399303,
+ "eval_loss": 0.7093168497085571,
+ "eval_mean_token_accuracy": 0.8500627639681794,
+ "eval_num_tokens": 5648968.0,
+ "eval_runtime": 85.8128,
+ "eval_samples_per_second": 16.023,
+ "eval_steps_per_second": 2.004,
+ "step": 2420
+ },
+ {
+ "entropy": 0.1534628233872354,
+ "epoch": 6.069738480697385,
+ "grad_norm": 0.710133969783783,
+ "learning_rate": 9.088662772316508e-05,
+ "loss": 0.09078952670097351,
+ "mean_token_accuracy": 0.9678447999060154,
+ "num_tokens": 5697633.0,
+ "step": 2440
+ },
+ {
+ "epoch": 6.069738480697385,
+ "eval_entropy": 0.28208133101809857,
+ "eval_loss": 0.7636417150497437,
+ "eval_mean_token_accuracy": 0.8494061477655588,
+ "eval_num_tokens": 5697633.0,
+ "eval_runtime": 85.9724,
+ "eval_samples_per_second": 15.994,
+ "eval_steps_per_second": 2.001,
+ "step": 2440
+ },
+ {
+ "entropy": 0.16151462448760867,
+ "epoch": 6.119551681195516,
+ "grad_norm": 0.5793812274932861,
+ "learning_rate": 8.896362400308028e-05,
+ "loss": 0.09545697569847107,
+ "mean_token_accuracy": 0.9671573750674725,
+ "num_tokens": 5745090.0,
+ "step": 2460
+ },
+ {
+ "epoch": 6.119551681195516,
+ "eval_entropy": 0.2833245605403601,
+ "eval_loss": 0.7402405738830566,
+ "eval_mean_token_accuracy": 0.8503523728875226,
+ "eval_num_tokens": 5745090.0,
+ "eval_runtime": 85.5461,
+ "eval_samples_per_second": 16.073,
+ "eval_steps_per_second": 2.011,
+ "step": 2460
+ },
+ {
+ "entropy": 0.15203177919611335,
+ "epoch": 6.169364881693649,
+ "grad_norm": 0.4251123368740082,
+ "learning_rate": 8.704791146635483e-05,
+ "loss": 0.09420782327651978,
+ "mean_token_accuracy": 0.9677386932075024,
+ "num_tokens": 5790333.0,
+ "step": 2480
+ },
+ {
+ "epoch": 6.169364881693649,
+ "eval_entropy": 0.28572545962971313,
+ "eval_loss": 0.735416829586029,
+ "eval_mean_token_accuracy": 0.8487084663884584,
+ "eval_num_tokens": 5790333.0,
+ "eval_runtime": 85.4801,
+ "eval_samples_per_second": 16.086,
+ "eval_steps_per_second": 2.012,
+ "step": 2480
+ },
+ {
+ "entropy": 0.15587336672469973,
+ "epoch": 6.219178082191781,
+ "grad_norm": 0.4357028007507324,
+ "learning_rate": 8.514006786576085e-05,
+ "loss": 0.09429320096969604,
+ "mean_token_accuracy": 0.9682952925562859,
+ "num_tokens": 5837321.0,
+ "step": 2500
+ },
+ {
+ "epoch": 6.219178082191781,
+ "eval_entropy": 0.2859006894882335,
+ "eval_loss": 0.7347224950790405,
+ "eval_mean_token_accuracy": 0.8501905518215757,
+ "eval_num_tokens": 5837321.0,
+ "eval_runtime": 85.7578,
+ "eval_samples_per_second": 16.034,
+ "eval_steps_per_second": 2.006,
+ "step": 2500
+ },
+ {
+ "entropy": 0.15765639198943973,
+ "epoch": 6.268991282689913,
+ "grad_norm": 0.47331130504608154,
+ "learning_rate": 8.324066858090663e-05,
+ "loss": 0.09571113586425781,
+ "mean_token_accuracy": 0.9683481335639954,
+ "num_tokens": 5884398.0,
+ "step": 2520
+ },
+ {
+ "epoch": 6.268991282689913,
+ "eval_entropy": 0.29231513846059176,
+ "eval_loss": 0.7392512559890747,
+ "eval_mean_token_accuracy": 0.8486633983462356,
+ "eval_num_tokens": 5884398.0,
+ "eval_runtime": 85.7846,
+ "eval_samples_per_second": 16.029,
+ "eval_steps_per_second": 2.005,
+ "step": 2520
+ },
+ {
+ "entropy": 0.16176860257983208,
+ "epoch": 6.318804483188045,
+ "grad_norm": 0.6142018437385559,
+ "learning_rate": 8.135028644470992e-05,
+ "loss": 0.09486144185066223,
+ "mean_token_accuracy": 0.9682316601276397,
+ "num_tokens": 5929876.0,
+ "step": 2540
+ },
+ {
+ "epoch": 6.318804483188045,
+ "eval_entropy": 0.2851274753379267,
+ "eval_loss": 0.7520816922187805,
+ "eval_mean_token_accuracy": 0.8501113649717597,
+ "eval_num_tokens": 5929876.0,
+ "eval_runtime": 85.9425,
+ "eval_samples_per_second": 15.999,
+ "eval_steps_per_second": 2.001,
+ "step": 2540
+ },
+ {
+ "entropy": 0.15404034564271568,
+ "epoch": 6.3686176836861765,
+ "grad_norm": 0.6051287651062012,
+ "learning_rate": 7.946949157063964e-05,
+ "loss": 0.09280472993850708,
+ "mean_token_accuracy": 0.9684635892510414,
+ "num_tokens": 5978490.0,
+ "step": 2560
+ },
+ {
+ "epoch": 6.3686176836861765,
+ "eval_entropy": 0.28802703563557114,
+ "eval_loss": 0.7439162135124207,
+ "eval_mean_token_accuracy": 0.8499851770872293,
+ "eval_num_tokens": 5978490.0,
+ "eval_runtime": 86.0703,
+ "eval_samples_per_second": 15.975,
+ "eval_steps_per_second": 1.998,
+ "step": 2560
+ },
+ {
+ "entropy": 0.15343588953837753,
+ "epoch": 6.418430884184309,
+ "grad_norm": 0.4823743402957916,
+ "learning_rate": 7.759885118077701e-05,
+ "loss": 0.09000591039657593,
+ "mean_token_accuracy": 0.9699928767979145,
+ "num_tokens": 6025380.0,
+ "step": 2580
+ },
+ {
+ "epoch": 6.418430884184309,
+ "eval_entropy": 0.2795634938533916,
+ "eval_loss": 0.7647850513458252,
+ "eval_mean_token_accuracy": 0.8503464397995971,
+ "eval_num_tokens": 6025380.0,
+ "eval_runtime": 85.8886,
+ "eval_samples_per_second": 16.009,
+ "eval_steps_per_second": 2.003,
+ "step": 2580
+ },
+ {
+ "entropy": 0.15740026142448188,
+ "epoch": 6.468244084682441,
+ "grad_norm": 0.5082696676254272,
+ "learning_rate": 7.57389294347494e-05,
+ "loss": 0.09191849827766418,
+ "mean_token_accuracy": 0.9692809768021107,
+ "num_tokens": 6073349.0,
+ "step": 2600
+ },
+ {
+ "epoch": 6.468244084682441,
+ "eval_entropy": 0.2913342311458532,
+ "eval_loss": 0.7518694996833801,
+ "eval_mean_token_accuracy": 0.8483168302580367,
+ "eval_num_tokens": 6073349.0,
+ "eval_runtime": 85.5761,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.01,
+ "step": 2600
+ },
+ {
+ "entropy": 0.15922069251537324,
+ "epoch": 6.518057285180573,
+ "grad_norm": 0.3995199501514435,
+ "learning_rate": 7.389028725958736e-05,
+ "loss": 0.09584367871284485,
+ "mean_token_accuracy": 0.9685114495456218,
+ "num_tokens": 6118148.0,
+ "step": 2620
+ },
+ {
+ "epoch": 6.518057285180573,
+ "eval_entropy": 0.2863075934177221,
+ "eval_loss": 0.7539381384849548,
+ "eval_mean_token_accuracy": 0.8507507083027862,
+ "eval_num_tokens": 6118148.0,
+ "eval_runtime": 86.112,
+ "eval_samples_per_second": 15.968,
+ "eval_steps_per_second": 1.997,
+ "step": 2620
+ },
+ {
+ "entropy": 0.16197575423866512,
+ "epoch": 6.567870485678705,
+ "grad_norm": 0.534295380115509,
+ "learning_rate": 7.205348218055678e-05,
+ "loss": 0.0961170256137848,
+ "mean_token_accuracy": 0.9674530044198036,
+ "num_tokens": 6165523.0,
+ "step": 2640
+ },
+ {
+ "epoch": 6.567870485678705,
+ "eval_entropy": 0.29021967315050057,
+ "eval_loss": 0.751198947429657,
+ "eval_mean_token_accuracy": 0.8509796344956686,
+ "eval_num_tokens": 6165523.0,
+ "eval_runtime": 85.7958,
+ "eval_samples_per_second": 16.026,
+ "eval_steps_per_second": 2.005,
+ "step": 2640
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.601385137194373e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2660/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2660/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2660/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2660/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2660/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2660/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2660/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2660/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2660/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2660/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2660/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2660/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2660/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2660/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..17c425add33d5aa7e0f922b49d269af10aca9ba9
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2660/trainer_state.json
@@ -0,0 +1,2827 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 6.617683686176837,
+ "eval_steps": 20,
+ "global_step": 2660,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ },
+ {
+ "entropy": 0.3193941755220294,
+ "epoch": 4.5280199252802,
+ "grad_norm": 0.8281906843185425,
+ "learning_rate": 0.0001509111761786888,
+ "loss": 0.23936262130737304,
+ "mean_token_accuracy": 0.9201708927750587,
+ "num_tokens": 4244423.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.5280199252802,
+ "eval_entropy": 0.38704028864239537,
+ "eval_loss": 0.6006569266319275,
+ "eval_mean_token_accuracy": 0.8502406720505205,
+ "eval_num_tokens": 4244423.0,
+ "eval_runtime": 86.8059,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1820
+ },
+ {
+ "entropy": 0.3164879363030195,
+ "epoch": 4.577833125778331,
+ "grad_norm": 0.7892968654632568,
+ "learning_rate": 0.00014905346557909867,
+ "loss": 0.24541733264923096,
+ "mean_token_accuracy": 0.9175932116806507,
+ "num_tokens": 4289773.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.577833125778331,
+ "eval_entropy": 0.38861122120951497,
+ "eval_loss": 0.6115967631340027,
+ "eval_mean_token_accuracy": 0.849471275196519,
+ "eval_num_tokens": 4289773.0,
+ "eval_runtime": 86.2946,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1840
+ },
+ {
+ "entropy": 0.3051785985007882,
+ "epoch": 4.627646326276463,
+ "grad_norm": 0.8109654188156128,
+ "learning_rate": 0.0001471849238862319,
+ "loss": 0.23433220386505127,
+ "mean_token_accuracy": 0.9206570319831371,
+ "num_tokens": 4336894.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.627646326276463,
+ "eval_entropy": 0.37162452295076015,
+ "eval_loss": 0.6184061765670776,
+ "eval_mean_token_accuracy": 0.8501173268223918,
+ "eval_num_tokens": 4336894.0,
+ "eval_runtime": 86.6865,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1860
+ },
+ {
+ "entropy": 0.3168198253959417,
+ "epoch": 4.677459526774595,
+ "grad_norm": 0.9512342214584351,
+ "learning_rate": 0.0001453061146267775,
+ "loss": 0.23832404613494873,
+ "mean_token_accuracy": 0.9197044663131237,
+ "num_tokens": 4382947.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.677459526774595,
+ "eval_entropy": 0.3845940856912801,
+ "eval_loss": 0.606762707233429,
+ "eval_mean_token_accuracy": 0.8504838194957999,
+ "eval_num_tokens": 4382947.0,
+ "eval_runtime": 86.5175,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 1880
+ },
+ {
+ "entropy": 0.30791807882487776,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 0.8123113512992859,
+ "learning_rate": 0.00014341760442398248,
+ "loss": 0.2395785331726074,
+ "mean_token_accuracy": 0.918928150832653,
+ "num_tokens": 4433050.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.7272727272727275,
+ "eval_entropy": 0.39762327222283494,
+ "eval_loss": 0.5994202494621277,
+ "eval_mean_token_accuracy": 0.8509274201337681,
+ "eval_num_tokens": 4433050.0,
+ "eval_runtime": 86.2873,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.993,
+ "step": 1900
+ },
+ {
+ "entropy": 0.3021434534341097,
+ "epoch": 4.777085927770859,
+ "grad_norm": 0.731787383556366,
+ "learning_rate": 0.000141519962826766,
+ "loss": 0.23494718074798585,
+ "mean_token_accuracy": 0.9201403826475143,
+ "num_tokens": 4483598.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.777085927770859,
+ "eval_entropy": 0.3827026732439219,
+ "eval_loss": 0.5995895862579346,
+ "eval_mean_token_accuracy": 0.851468373523202,
+ "eval_num_tokens": 4483598.0,
+ "eval_runtime": 86.3006,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 1920
+ },
+ {
+ "entropy": 0.31626159623265265,
+ "epoch": 4.826899128268991,
+ "grad_norm": 0.8848487138748169,
+ "learning_rate": 0.00013961376213795132,
+ "loss": 0.2439030647277832,
+ "mean_token_accuracy": 0.9196575872600079,
+ "num_tokens": 4529201.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.826899128268991,
+ "eval_entropy": 0.388698436839636,
+ "eval_loss": 0.6000174283981323,
+ "eval_mean_token_accuracy": 0.8518068187458571,
+ "eval_num_tokens": 4529201.0,
+ "eval_runtime": 86.8979,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.979,
+ "step": 1940
+ },
+ {
+ "entropy": 0.30520407035946845,
+ "epoch": 4.876712328767123,
+ "grad_norm": 0.8532460927963257,
+ "learning_rate": 0.00013769957724166695,
+ "loss": 0.23458616733551024,
+ "mean_token_accuracy": 0.9221912942826748,
+ "num_tokens": 4578167.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.876712328767123,
+ "eval_entropy": 0.38777847102908203,
+ "eval_loss": 0.6004981398582458,
+ "eval_mean_token_accuracy": 0.8516481768253238,
+ "eval_num_tokens": 4578167.0,
+ "eval_runtime": 87.0777,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.975,
+ "step": 1960
+ },
+ {
+ "entropy": 0.3226448342204094,
+ "epoch": 4.926525529265255,
+ "grad_norm": 0.6945561766624451,
+ "learning_rate": 0.0001357779854299694,
+ "loss": 0.24048397541046143,
+ "mean_token_accuracy": 0.9195300146937371,
+ "num_tokens": 4622316.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.926525529265255,
+ "eval_entropy": 0.38581624263247777,
+ "eval_loss": 0.6029234528541565,
+ "eval_mean_token_accuracy": 0.8514213260523108,
+ "eval_num_tokens": 4622316.0,
+ "eval_runtime": 85.8729,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 1980
+ },
+ {
+ "entropy": 0.3051655298098922,
+ "epoch": 4.976338729763388,
+ "grad_norm": 0.7976452708244324,
+ "learning_rate": 0.00013384956622874001,
+ "loss": 0.23584742546081544,
+ "mean_token_accuracy": 0.9216851457953453,
+ "num_tokens": 4670746.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.976338729763388,
+ "eval_entropy": 0.37913159246361533,
+ "eval_loss": 0.6057604551315308,
+ "eval_mean_token_accuracy": 0.8525801203971686,
+ "eval_num_tokens": 4670746.0,
+ "eval_runtime": 86.1145,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2000
+ },
+ {
+ "entropy": 0.27438195240803254,
+ "epoch": 5.024906600249066,
+ "grad_norm": 0.6729586124420166,
+ "learning_rate": 0.0001319149012229075,
+ "loss": 0.19775952100753785,
+ "mean_token_accuracy": 0.9339428559327737,
+ "num_tokens": 4716176.0,
+ "step": 2020
+ },
+ {
+ "epoch": 5.024906600249066,
+ "eval_entropy": 0.3448961910813354,
+ "eval_loss": 0.6750120520591736,
+ "eval_mean_token_accuracy": 0.8487970232963562,
+ "eval_num_tokens": 4716176.0,
+ "eval_runtime": 86.1169,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2020
+ },
+ {
+ "entropy": 0.21423916313797237,
+ "epoch": 5.074719800747198,
+ "grad_norm": 0.6934391856193542,
+ "learning_rate": 0.00012997457388105022,
+ "loss": 0.1439570426940918,
+ "mean_token_accuracy": 0.9528236843645572,
+ "num_tokens": 4763269.0,
+ "step": 2040
+ },
+ {
+ "epoch": 5.074719800747198,
+ "eval_entropy": 0.3570949243771475,
+ "eval_loss": 0.6465504169464111,
+ "eval_mean_token_accuracy": 0.8490785547467166,
+ "eval_num_tokens": 4763269.0,
+ "eval_runtime": 85.9574,
+ "eval_samples_per_second": 15.996,
+ "eval_steps_per_second": 2.001,
+ "step": 2040
+ },
+ {
+ "entropy": 0.20838565267622472,
+ "epoch": 5.12453300124533,
+ "grad_norm": 0.7286986112594604,
+ "learning_rate": 0.00012802916937942972,
+ "loss": 0.14467307329177856,
+ "mean_token_accuracy": 0.950994835793972,
+ "num_tokens": 4809047.0,
+ "step": 2060
+ },
+ {
+ "epoch": 5.12453300124533,
+ "eval_entropy": 0.3452463157821533,
+ "eval_loss": 0.6705958843231201,
+ "eval_mean_token_accuracy": 0.8490352796953778,
+ "eval_num_tokens": 4809047.0,
+ "eval_runtime": 86.228,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 2060
+ },
+ {
+ "entropy": 0.20453082229942082,
+ "epoch": 5.174346201743462,
+ "grad_norm": 0.7515555620193481,
+ "learning_rate": 0.00012607927442550974,
+ "loss": 0.13732000589370727,
+ "mean_token_accuracy": 0.9537357829511166,
+ "num_tokens": 4857965.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.174346201743462,
+ "eval_entropy": 0.32431264914745506,
+ "eval_loss": 0.6743043065071106,
+ "eval_mean_token_accuracy": 0.8504878629085629,
+ "eval_num_tokens": 4857965.0,
+ "eval_runtime": 86.5948,
+ "eval_samples_per_second": 15.879,
+ "eval_steps_per_second": 1.986,
+ "step": 2080
+ },
+ {
+ "entropy": 0.21812320686876774,
+ "epoch": 5.224159402241594,
+ "grad_norm": 0.9093465209007263,
+ "learning_rate": 0.0001241254770810132,
+ "loss": 0.14311420917510986,
+ "mean_token_accuracy": 0.9514068141579628,
+ "num_tokens": 4905151.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.224159402241594,
+ "eval_entropy": 0.33086285835435225,
+ "eval_loss": 0.6676449179649353,
+ "eval_mean_token_accuracy": 0.8505287662495015,
+ "eval_num_tokens": 4905151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 2100
+ },
+ {
+ "entropy": 0.2180163251236081,
+ "epoch": 5.273972602739726,
+ "grad_norm": 0.6703007221221924,
+ "learning_rate": 0.00012216836658457075,
+ "loss": 0.14803968667984008,
+ "mean_token_accuracy": 0.9521303348243236,
+ "num_tokens": 4947072.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.273972602739726,
+ "eval_entropy": 0.33162341708707255,
+ "eval_loss": 0.6658875942230225,
+ "eval_mean_token_accuracy": 0.8500757605530495,
+ "eval_num_tokens": 4947072.0,
+ "eval_runtime": 86.6296,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 2120
+ },
+ {
+ "entropy": 0.22511130161583423,
+ "epoch": 5.323785803237858,
+ "grad_norm": 0.8078880906105042,
+ "learning_rate": 0.00012020853317401455,
+ "loss": 0.15228408575057983,
+ "mean_token_accuracy": 0.947144789993763,
+ "num_tokens": 4991974.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.323785803237858,
+ "eval_entropy": 0.3354601170434508,
+ "eval_loss": 0.6677829623222351,
+ "eval_mean_token_accuracy": 0.8482600024273229,
+ "eval_num_tokens": 4991974.0,
+ "eval_runtime": 86.4689,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.989,
+ "step": 2140
+ },
+ {
+ "entropy": 0.2244176059961319,
+ "epoch": 5.37359900373599,
+ "grad_norm": 0.9636075496673584,
+ "learning_rate": 0.00011824656790837037,
+ "loss": 0.15260883569717407,
+ "mean_token_accuracy": 0.9471467643976211,
+ "num_tokens": 5038400.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.37359900373599,
+ "eval_entropy": 0.3381616926297199,
+ "eval_loss": 0.6694412231445312,
+ "eval_mean_token_accuracy": 0.8482369603805764,
+ "eval_num_tokens": 5038400.0,
+ "eval_runtime": 86.4147,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 2160
+ },
+ {
+ "entropy": 0.22982364390045404,
+ "epoch": 5.423412204234122,
+ "grad_norm": 0.775401771068573,
+ "learning_rate": 0.00011628306248960262,
+ "loss": 0.15140302181243898,
+ "mean_token_accuracy": 0.9492553934454918,
+ "num_tokens": 5083166.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.423412204234122,
+ "eval_entropy": 0.3305150235808173,
+ "eval_loss": 0.6717822551727295,
+ "eval_mean_token_accuracy": 0.8489849723355715,
+ "eval_num_tokens": 5083166.0,
+ "eval_runtime": 86.4728,
+ "eval_samples_per_second": 15.901,
+ "eval_steps_per_second": 1.989,
+ "step": 2180
+ },
+ {
+ "entropy": 0.21448935717344284,
+ "epoch": 5.473225404732254,
+ "grad_norm": 0.6575281023979187,
+ "learning_rate": 0.00011431860908416465,
+ "loss": 0.1452319622039795,
+ "mean_token_accuracy": 0.9505287684500218,
+ "num_tokens": 5135109.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.473225404732254,
+ "eval_entropy": 0.3488145174328671,
+ "eval_loss": 0.6612305641174316,
+ "eval_mean_token_accuracy": 0.8492907808963642,
+ "eval_num_tokens": 5135109.0,
+ "eval_runtime": 86.6927,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 2200
+ },
+ {
+ "entropy": 0.23091202937066554,
+ "epoch": 5.523038605230386,
+ "grad_norm": 0.8909686207771301,
+ "learning_rate": 0.00011235380014440985,
+ "loss": 0.15150139331817628,
+ "mean_token_accuracy": 0.9497875183820724,
+ "num_tokens": 5180138.0,
+ "step": 2220
+ },
+ {
+ "epoch": 5.523038605230386,
+ "eval_entropy": 0.3268539015810157,
+ "eval_loss": 0.6667542457580566,
+ "eval_mean_token_accuracy": 0.8499062903398691,
+ "eval_num_tokens": 5180138.0,
+ "eval_runtime": 86.4644,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 2220
+ },
+ {
+ "entropy": 0.2227974807843566,
+ "epoch": 5.572851805728518,
+ "grad_norm": 0.6180275082588196,
+ "learning_rate": 0.0001103892282299158,
+ "loss": 0.1491069197654724,
+ "mean_token_accuracy": 0.9488144010305405,
+ "num_tokens": 5226864.0,
+ "step": 2240
+ },
+ {
+ "epoch": 5.572851805728518,
+ "eval_entropy": 0.3346347655494546,
+ "eval_loss": 0.6665948629379272,
+ "eval_mean_token_accuracy": 0.8499961893918903,
+ "eval_num_tokens": 5226864.0,
+ "eval_runtime": 87.0548,
+ "eval_samples_per_second": 15.795,
+ "eval_steps_per_second": 1.976,
+ "step": 2240
+ },
+ {
+ "entropy": 0.21368421968072654,
+ "epoch": 5.62266500622665,
+ "grad_norm": 0.6004369258880615,
+ "learning_rate": 0.00010842548582877651,
+ "loss": 0.14485255479812623,
+ "mean_token_accuracy": 0.9502056457102299,
+ "num_tokens": 5276602.0,
+ "step": 2260
+ },
+ {
+ "epoch": 5.62266500622665,
+ "eval_entropy": 0.32753298804163933,
+ "eval_loss": 0.6680151224136353,
+ "eval_mean_token_accuracy": 0.8515451086121936,
+ "eval_num_tokens": 5276602.0,
+ "eval_runtime": 86.8524,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.98,
+ "step": 2260
+ },
+ {
+ "entropy": 0.2103635374456644,
+ "epoch": 5.672478206724782,
+ "grad_norm": 0.699174702167511,
+ "learning_rate": 0.00010646316517891613,
+ "loss": 0.14297772645950318,
+ "mean_token_accuracy": 0.9512537539005279,
+ "num_tokens": 5323718.0,
+ "step": 2280
+ },
+ {
+ "epoch": 5.672478206724782,
+ "eval_entropy": 0.32966585959806,
+ "eval_loss": 0.675578773021698,
+ "eval_mean_token_accuracy": 0.8509623023659684,
+ "eval_num_tokens": 5323718.0,
+ "eval_runtime": 86.4518,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2280
+ },
+ {
+ "entropy": 0.22516900151968003,
+ "epoch": 5.722291407222914,
+ "grad_norm": 0.6637354493141174,
+ "learning_rate": 0.00010450285808947797,
+ "loss": 0.15202572345733642,
+ "mean_token_accuracy": 0.9482452072203159,
+ "num_tokens": 5369039.0,
+ "step": 2300
+ },
+ {
+ "epoch": 5.722291407222914,
+ "eval_entropy": 0.3369456917740578,
+ "eval_loss": 0.6697061061859131,
+ "eval_mean_token_accuracy": 0.848603522361711,
+ "eval_num_tokens": 5369039.0,
+ "eval_runtime": 86.6371,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.985,
+ "step": 2300
+ },
+ {
+ "entropy": 0.21841065725311637,
+ "epoch": 5.772104607721046,
+ "grad_norm": 0.7940268516540527,
+ "learning_rate": 0.00010254515576234297,
+ "loss": 0.14710167646408082,
+ "mean_token_accuracy": 0.9493498183786869,
+ "num_tokens": 5417029.0,
+ "step": 2320
+ },
+ {
+ "epoch": 5.772104607721046,
+ "eval_entropy": 0.3237486180177955,
+ "eval_loss": 0.6779657602310181,
+ "eval_mean_token_accuracy": 0.8500715313955794,
+ "eval_num_tokens": 5417029.0,
+ "eval_runtime": 86.1826,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 1.996,
+ "step": 2320
+ },
+ {
+ "entropy": 0.22146204356104135,
+ "epoch": 5.821917808219178,
+ "grad_norm": 0.9234833121299744,
+ "learning_rate": 0.00010059064861383132,
+ "loss": 0.14720046520233154,
+ "mean_token_accuracy": 0.9493872679769992,
+ "num_tokens": 5461671.0,
+ "step": 2340
+ },
+ {
+ "epoch": 5.821917808219178,
+ "eval_entropy": 0.32365207564692167,
+ "eval_loss": 0.6704005002975464,
+ "eval_mean_token_accuracy": 0.8507985760306203,
+ "eval_num_tokens": 5461671.0,
+ "eval_runtime": 86.5494,
+ "eval_samples_per_second": 15.887,
+ "eval_steps_per_second": 1.987,
+ "step": 2340
+ },
+ {
+ "entropy": 0.20934011954814197,
+ "epoch": 5.87173100871731,
+ "grad_norm": 0.5547503232955933,
+ "learning_rate": 9.863992609664084e-05,
+ "loss": 0.1464867353439331,
+ "mean_token_accuracy": 0.9503875687718392,
+ "num_tokens": 5509312.0,
+ "step": 2360
+ },
+ {
+ "epoch": 5.87173100871731,
+ "eval_entropy": 0.3330401429083458,
+ "eval_loss": 0.6659091114997864,
+ "eval_mean_token_accuracy": 0.8504848906467127,
+ "eval_num_tokens": 5509312.0,
+ "eval_runtime": 86.5855,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 2360
+ },
+ {
+ "entropy": 0.21678635366261007,
+ "epoch": 5.921544209215442,
+ "grad_norm": 0.570612907409668,
+ "learning_rate": 9.669357652207635e-05,
+ "loss": 0.14821385145187377,
+ "mean_token_accuracy": 0.9503940217196941,
+ "num_tokens": 5558196.0,
+ "step": 2380
+ },
+ {
+ "epoch": 5.921544209215442,
+ "eval_entropy": 0.3322022325077722,
+ "eval_loss": 0.6722489595413208,
+ "eval_mean_token_accuracy": 0.8489979422369669,
+ "eval_num_tokens": 5558196.0,
+ "eval_runtime": 86.2986,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 2380
+ },
+ {
+ "entropy": 0.20932920072227718,
+ "epoch": 5.971357409713574,
+ "grad_norm": 0.7879557609558105,
+ "learning_rate": 9.475218688262262e-05,
+ "loss": 0.14675841331481934,
+ "mean_token_accuracy": 0.9507176131010056,
+ "num_tokens": 5605400.0,
+ "step": 2400
+ },
+ {
+ "epoch": 5.971357409713574,
+ "eval_entropy": 0.3199348642902319,
+ "eval_loss": 0.6698136329650879,
+ "eval_mean_token_accuracy": 0.8514142130003419,
+ "eval_num_tokens": 5605400.0,
+ "eval_runtime": 85.8995,
+ "eval_samples_per_second": 16.007,
+ "eval_steps_per_second": 2.002,
+ "step": 2400
+ },
+ {
+ "entropy": 0.21032143919131693,
+ "epoch": 6.019925280199253,
+ "grad_norm": 0.5823076367378235,
+ "learning_rate": 9.281634267491569e-05,
+ "loss": 0.13322267532348633,
+ "mean_token_accuracy": 0.9550939072401096,
+ "num_tokens": 5648968.0,
+ "step": 2420
+ },
+ {
+ "epoch": 6.019925280199253,
+ "eval_entropy": 0.30206270117399303,
+ "eval_loss": 0.7093168497085571,
+ "eval_mean_token_accuracy": 0.8500627639681794,
+ "eval_num_tokens": 5648968.0,
+ "eval_runtime": 85.8128,
+ "eval_samples_per_second": 16.023,
+ "eval_steps_per_second": 2.004,
+ "step": 2420
+ },
+ {
+ "entropy": 0.1534628233872354,
+ "epoch": 6.069738480697385,
+ "grad_norm": 0.710133969783783,
+ "learning_rate": 9.088662772316508e-05,
+ "loss": 0.09078952670097351,
+ "mean_token_accuracy": 0.9678447999060154,
+ "num_tokens": 5697633.0,
+ "step": 2440
+ },
+ {
+ "epoch": 6.069738480697385,
+ "eval_entropy": 0.28208133101809857,
+ "eval_loss": 0.7636417150497437,
+ "eval_mean_token_accuracy": 0.8494061477655588,
+ "eval_num_tokens": 5697633.0,
+ "eval_runtime": 85.9724,
+ "eval_samples_per_second": 15.994,
+ "eval_steps_per_second": 2.001,
+ "step": 2440
+ },
+ {
+ "entropy": 0.16151462448760867,
+ "epoch": 6.119551681195516,
+ "grad_norm": 0.5793812274932861,
+ "learning_rate": 8.896362400308028e-05,
+ "loss": 0.09545697569847107,
+ "mean_token_accuracy": 0.9671573750674725,
+ "num_tokens": 5745090.0,
+ "step": 2460
+ },
+ {
+ "epoch": 6.119551681195516,
+ "eval_entropy": 0.2833245605403601,
+ "eval_loss": 0.7402405738830566,
+ "eval_mean_token_accuracy": 0.8503523728875226,
+ "eval_num_tokens": 5745090.0,
+ "eval_runtime": 85.5461,
+ "eval_samples_per_second": 16.073,
+ "eval_steps_per_second": 2.011,
+ "step": 2460
+ },
+ {
+ "entropy": 0.15203177919611335,
+ "epoch": 6.169364881693649,
+ "grad_norm": 0.4251123368740082,
+ "learning_rate": 8.704791146635483e-05,
+ "loss": 0.09420782327651978,
+ "mean_token_accuracy": 0.9677386932075024,
+ "num_tokens": 5790333.0,
+ "step": 2480
+ },
+ {
+ "epoch": 6.169364881693649,
+ "eval_entropy": 0.28572545962971313,
+ "eval_loss": 0.735416829586029,
+ "eval_mean_token_accuracy": 0.8487084663884584,
+ "eval_num_tokens": 5790333.0,
+ "eval_runtime": 85.4801,
+ "eval_samples_per_second": 16.086,
+ "eval_steps_per_second": 2.012,
+ "step": 2480
+ },
+ {
+ "entropy": 0.15587336672469973,
+ "epoch": 6.219178082191781,
+ "grad_norm": 0.4357028007507324,
+ "learning_rate": 8.514006786576085e-05,
+ "loss": 0.09429320096969604,
+ "mean_token_accuracy": 0.9682952925562859,
+ "num_tokens": 5837321.0,
+ "step": 2500
+ },
+ {
+ "epoch": 6.219178082191781,
+ "eval_entropy": 0.2859006894882335,
+ "eval_loss": 0.7347224950790405,
+ "eval_mean_token_accuracy": 0.8501905518215757,
+ "eval_num_tokens": 5837321.0,
+ "eval_runtime": 85.7578,
+ "eval_samples_per_second": 16.034,
+ "eval_steps_per_second": 2.006,
+ "step": 2500
+ },
+ {
+ "entropy": 0.15765639198943973,
+ "epoch": 6.268991282689913,
+ "grad_norm": 0.47331130504608154,
+ "learning_rate": 8.324066858090663e-05,
+ "loss": 0.09571113586425781,
+ "mean_token_accuracy": 0.9683481335639954,
+ "num_tokens": 5884398.0,
+ "step": 2520
+ },
+ {
+ "epoch": 6.268991282689913,
+ "eval_entropy": 0.29231513846059176,
+ "eval_loss": 0.7392512559890747,
+ "eval_mean_token_accuracy": 0.8486633983462356,
+ "eval_num_tokens": 5884398.0,
+ "eval_runtime": 85.7846,
+ "eval_samples_per_second": 16.029,
+ "eval_steps_per_second": 2.005,
+ "step": 2520
+ },
+ {
+ "entropy": 0.16176860257983208,
+ "epoch": 6.318804483188045,
+ "grad_norm": 0.6142018437385559,
+ "learning_rate": 8.135028644470992e-05,
+ "loss": 0.09486144185066223,
+ "mean_token_accuracy": 0.9682316601276397,
+ "num_tokens": 5929876.0,
+ "step": 2540
+ },
+ {
+ "epoch": 6.318804483188045,
+ "eval_entropy": 0.2851274753379267,
+ "eval_loss": 0.7520816922187805,
+ "eval_mean_token_accuracy": 0.8501113649717597,
+ "eval_num_tokens": 5929876.0,
+ "eval_runtime": 85.9425,
+ "eval_samples_per_second": 15.999,
+ "eval_steps_per_second": 2.001,
+ "step": 2540
+ },
+ {
+ "entropy": 0.15404034564271568,
+ "epoch": 6.3686176836861765,
+ "grad_norm": 0.6051287651062012,
+ "learning_rate": 7.946949157063964e-05,
+ "loss": 0.09280472993850708,
+ "mean_token_accuracy": 0.9684635892510414,
+ "num_tokens": 5978490.0,
+ "step": 2560
+ },
+ {
+ "epoch": 6.3686176836861765,
+ "eval_entropy": 0.28802703563557114,
+ "eval_loss": 0.7439162135124207,
+ "eval_mean_token_accuracy": 0.8499851770872293,
+ "eval_num_tokens": 5978490.0,
+ "eval_runtime": 86.0703,
+ "eval_samples_per_second": 15.975,
+ "eval_steps_per_second": 1.998,
+ "step": 2560
+ },
+ {
+ "entropy": 0.15343588953837753,
+ "epoch": 6.418430884184309,
+ "grad_norm": 0.4823743402957916,
+ "learning_rate": 7.759885118077701e-05,
+ "loss": 0.09000591039657593,
+ "mean_token_accuracy": 0.9699928767979145,
+ "num_tokens": 6025380.0,
+ "step": 2580
+ },
+ {
+ "epoch": 6.418430884184309,
+ "eval_entropy": 0.2795634938533916,
+ "eval_loss": 0.7647850513458252,
+ "eval_mean_token_accuracy": 0.8503464397995971,
+ "eval_num_tokens": 6025380.0,
+ "eval_runtime": 85.8886,
+ "eval_samples_per_second": 16.009,
+ "eval_steps_per_second": 2.003,
+ "step": 2580
+ },
+ {
+ "entropy": 0.15740026142448188,
+ "epoch": 6.468244084682441,
+ "grad_norm": 0.5082696676254272,
+ "learning_rate": 7.57389294347494e-05,
+ "loss": 0.09191849827766418,
+ "mean_token_accuracy": 0.9692809768021107,
+ "num_tokens": 6073349.0,
+ "step": 2600
+ },
+ {
+ "epoch": 6.468244084682441,
+ "eval_entropy": 0.2913342311458532,
+ "eval_loss": 0.7518694996833801,
+ "eval_mean_token_accuracy": 0.8483168302580367,
+ "eval_num_tokens": 6073349.0,
+ "eval_runtime": 85.5761,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.01,
+ "step": 2600
+ },
+ {
+ "entropy": 0.15922069251537324,
+ "epoch": 6.518057285180573,
+ "grad_norm": 0.3995199501514435,
+ "learning_rate": 7.389028725958736e-05,
+ "loss": 0.09584367871284485,
+ "mean_token_accuracy": 0.9685114495456218,
+ "num_tokens": 6118148.0,
+ "step": 2620
+ },
+ {
+ "epoch": 6.518057285180573,
+ "eval_entropy": 0.2863075934177221,
+ "eval_loss": 0.7539381384849548,
+ "eval_mean_token_accuracy": 0.8507507083027862,
+ "eval_num_tokens": 6118148.0,
+ "eval_runtime": 86.112,
+ "eval_samples_per_second": 15.968,
+ "eval_steps_per_second": 1.997,
+ "step": 2620
+ },
+ {
+ "entropy": 0.16197575423866512,
+ "epoch": 6.567870485678705,
+ "grad_norm": 0.534295380115509,
+ "learning_rate": 7.205348218055678e-05,
+ "loss": 0.0961170256137848,
+ "mean_token_accuracy": 0.9674530044198036,
+ "num_tokens": 6165523.0,
+ "step": 2640
+ },
+ {
+ "epoch": 6.567870485678705,
+ "eval_entropy": 0.29021967315050057,
+ "eval_loss": 0.751198947429657,
+ "eval_mean_token_accuracy": 0.8509796344956686,
+ "eval_num_tokens": 6165523.0,
+ "eval_runtime": 85.7958,
+ "eval_samples_per_second": 16.026,
+ "eval_steps_per_second": 2.005,
+ "step": 2640
+ },
+ {
+ "entropy": 0.15261746793985367,
+ "epoch": 6.617683686176837,
+ "grad_norm": 0.5391237139701843,
+ "learning_rate": 7.022906815301673e-05,
+ "loss": 0.0926026999950409,
+ "mean_token_accuracy": 0.9695659473538398,
+ "num_tokens": 6216232.0,
+ "step": 2660
+ },
+ {
+ "epoch": 6.617683686176837,
+ "eval_entropy": 0.29128045216202736,
+ "eval_loss": 0.7450292110443115,
+ "eval_mean_token_accuracy": 0.8498771443616512,
+ "eval_num_tokens": 6216232.0,
+ "eval_runtime": 86.3963,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 2660
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.622312241424978e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2680/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2680/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2680/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2680/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2680/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2680/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2680/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2680/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2680/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2680/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2680/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2680/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2680/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2680/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..33e36298c68bb0d420896b0ed23814e3415e6817
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2680/trainer_state.json
@@ -0,0 +1,2848 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 6.667496886674969,
+ "eval_steps": 20,
+ "global_step": 2680,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ },
+ {
+ "entropy": 0.3193941755220294,
+ "epoch": 4.5280199252802,
+ "grad_norm": 0.8281906843185425,
+ "learning_rate": 0.0001509111761786888,
+ "loss": 0.23936262130737304,
+ "mean_token_accuracy": 0.9201708927750587,
+ "num_tokens": 4244423.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.5280199252802,
+ "eval_entropy": 0.38704028864239537,
+ "eval_loss": 0.6006569266319275,
+ "eval_mean_token_accuracy": 0.8502406720505205,
+ "eval_num_tokens": 4244423.0,
+ "eval_runtime": 86.8059,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1820
+ },
+ {
+ "entropy": 0.3164879363030195,
+ "epoch": 4.577833125778331,
+ "grad_norm": 0.7892968654632568,
+ "learning_rate": 0.00014905346557909867,
+ "loss": 0.24541733264923096,
+ "mean_token_accuracy": 0.9175932116806507,
+ "num_tokens": 4289773.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.577833125778331,
+ "eval_entropy": 0.38861122120951497,
+ "eval_loss": 0.6115967631340027,
+ "eval_mean_token_accuracy": 0.849471275196519,
+ "eval_num_tokens": 4289773.0,
+ "eval_runtime": 86.2946,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1840
+ },
+ {
+ "entropy": 0.3051785985007882,
+ "epoch": 4.627646326276463,
+ "grad_norm": 0.8109654188156128,
+ "learning_rate": 0.0001471849238862319,
+ "loss": 0.23433220386505127,
+ "mean_token_accuracy": 0.9206570319831371,
+ "num_tokens": 4336894.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.627646326276463,
+ "eval_entropy": 0.37162452295076015,
+ "eval_loss": 0.6184061765670776,
+ "eval_mean_token_accuracy": 0.8501173268223918,
+ "eval_num_tokens": 4336894.0,
+ "eval_runtime": 86.6865,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1860
+ },
+ {
+ "entropy": 0.3168198253959417,
+ "epoch": 4.677459526774595,
+ "grad_norm": 0.9512342214584351,
+ "learning_rate": 0.0001453061146267775,
+ "loss": 0.23832404613494873,
+ "mean_token_accuracy": 0.9197044663131237,
+ "num_tokens": 4382947.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.677459526774595,
+ "eval_entropy": 0.3845940856912801,
+ "eval_loss": 0.606762707233429,
+ "eval_mean_token_accuracy": 0.8504838194957999,
+ "eval_num_tokens": 4382947.0,
+ "eval_runtime": 86.5175,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 1880
+ },
+ {
+ "entropy": 0.30791807882487776,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 0.8123113512992859,
+ "learning_rate": 0.00014341760442398248,
+ "loss": 0.2395785331726074,
+ "mean_token_accuracy": 0.918928150832653,
+ "num_tokens": 4433050.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.7272727272727275,
+ "eval_entropy": 0.39762327222283494,
+ "eval_loss": 0.5994202494621277,
+ "eval_mean_token_accuracy": 0.8509274201337681,
+ "eval_num_tokens": 4433050.0,
+ "eval_runtime": 86.2873,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.993,
+ "step": 1900
+ },
+ {
+ "entropy": 0.3021434534341097,
+ "epoch": 4.777085927770859,
+ "grad_norm": 0.731787383556366,
+ "learning_rate": 0.000141519962826766,
+ "loss": 0.23494718074798585,
+ "mean_token_accuracy": 0.9201403826475143,
+ "num_tokens": 4483598.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.777085927770859,
+ "eval_entropy": 0.3827026732439219,
+ "eval_loss": 0.5995895862579346,
+ "eval_mean_token_accuracy": 0.851468373523202,
+ "eval_num_tokens": 4483598.0,
+ "eval_runtime": 86.3006,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 1920
+ },
+ {
+ "entropy": 0.31626159623265265,
+ "epoch": 4.826899128268991,
+ "grad_norm": 0.8848487138748169,
+ "learning_rate": 0.00013961376213795132,
+ "loss": 0.2439030647277832,
+ "mean_token_accuracy": 0.9196575872600079,
+ "num_tokens": 4529201.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.826899128268991,
+ "eval_entropy": 0.388698436839636,
+ "eval_loss": 0.6000174283981323,
+ "eval_mean_token_accuracy": 0.8518068187458571,
+ "eval_num_tokens": 4529201.0,
+ "eval_runtime": 86.8979,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.979,
+ "step": 1940
+ },
+ {
+ "entropy": 0.30520407035946845,
+ "epoch": 4.876712328767123,
+ "grad_norm": 0.8532460927963257,
+ "learning_rate": 0.00013769957724166695,
+ "loss": 0.23458616733551024,
+ "mean_token_accuracy": 0.9221912942826748,
+ "num_tokens": 4578167.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.876712328767123,
+ "eval_entropy": 0.38777847102908203,
+ "eval_loss": 0.6004981398582458,
+ "eval_mean_token_accuracy": 0.8516481768253238,
+ "eval_num_tokens": 4578167.0,
+ "eval_runtime": 87.0777,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.975,
+ "step": 1960
+ },
+ {
+ "entropy": 0.3226448342204094,
+ "epoch": 4.926525529265255,
+ "grad_norm": 0.6945561766624451,
+ "learning_rate": 0.0001357779854299694,
+ "loss": 0.24048397541046143,
+ "mean_token_accuracy": 0.9195300146937371,
+ "num_tokens": 4622316.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.926525529265255,
+ "eval_entropy": 0.38581624263247777,
+ "eval_loss": 0.6029234528541565,
+ "eval_mean_token_accuracy": 0.8514213260523108,
+ "eval_num_tokens": 4622316.0,
+ "eval_runtime": 85.8729,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 1980
+ },
+ {
+ "entropy": 0.3051655298098922,
+ "epoch": 4.976338729763388,
+ "grad_norm": 0.7976452708244324,
+ "learning_rate": 0.00013384956622874001,
+ "loss": 0.23584742546081544,
+ "mean_token_accuracy": 0.9216851457953453,
+ "num_tokens": 4670746.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.976338729763388,
+ "eval_entropy": 0.37913159246361533,
+ "eval_loss": 0.6057604551315308,
+ "eval_mean_token_accuracy": 0.8525801203971686,
+ "eval_num_tokens": 4670746.0,
+ "eval_runtime": 86.1145,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2000
+ },
+ {
+ "entropy": 0.27438195240803254,
+ "epoch": 5.024906600249066,
+ "grad_norm": 0.6729586124420166,
+ "learning_rate": 0.0001319149012229075,
+ "loss": 0.19775952100753785,
+ "mean_token_accuracy": 0.9339428559327737,
+ "num_tokens": 4716176.0,
+ "step": 2020
+ },
+ {
+ "epoch": 5.024906600249066,
+ "eval_entropy": 0.3448961910813354,
+ "eval_loss": 0.6750120520591736,
+ "eval_mean_token_accuracy": 0.8487970232963562,
+ "eval_num_tokens": 4716176.0,
+ "eval_runtime": 86.1169,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2020
+ },
+ {
+ "entropy": 0.21423916313797237,
+ "epoch": 5.074719800747198,
+ "grad_norm": 0.6934391856193542,
+ "learning_rate": 0.00012997457388105022,
+ "loss": 0.1439570426940918,
+ "mean_token_accuracy": 0.9528236843645572,
+ "num_tokens": 4763269.0,
+ "step": 2040
+ },
+ {
+ "epoch": 5.074719800747198,
+ "eval_entropy": 0.3570949243771475,
+ "eval_loss": 0.6465504169464111,
+ "eval_mean_token_accuracy": 0.8490785547467166,
+ "eval_num_tokens": 4763269.0,
+ "eval_runtime": 85.9574,
+ "eval_samples_per_second": 15.996,
+ "eval_steps_per_second": 2.001,
+ "step": 2040
+ },
+ {
+ "entropy": 0.20838565267622472,
+ "epoch": 5.12453300124533,
+ "grad_norm": 0.7286986112594604,
+ "learning_rate": 0.00012802916937942972,
+ "loss": 0.14467307329177856,
+ "mean_token_accuracy": 0.950994835793972,
+ "num_tokens": 4809047.0,
+ "step": 2060
+ },
+ {
+ "epoch": 5.12453300124533,
+ "eval_entropy": 0.3452463157821533,
+ "eval_loss": 0.6705958843231201,
+ "eval_mean_token_accuracy": 0.8490352796953778,
+ "eval_num_tokens": 4809047.0,
+ "eval_runtime": 86.228,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 2060
+ },
+ {
+ "entropy": 0.20453082229942082,
+ "epoch": 5.174346201743462,
+ "grad_norm": 0.7515555620193481,
+ "learning_rate": 0.00012607927442550974,
+ "loss": 0.13732000589370727,
+ "mean_token_accuracy": 0.9537357829511166,
+ "num_tokens": 4857965.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.174346201743462,
+ "eval_entropy": 0.32431264914745506,
+ "eval_loss": 0.6743043065071106,
+ "eval_mean_token_accuracy": 0.8504878629085629,
+ "eval_num_tokens": 4857965.0,
+ "eval_runtime": 86.5948,
+ "eval_samples_per_second": 15.879,
+ "eval_steps_per_second": 1.986,
+ "step": 2080
+ },
+ {
+ "entropy": 0.21812320686876774,
+ "epoch": 5.224159402241594,
+ "grad_norm": 0.9093465209007263,
+ "learning_rate": 0.0001241254770810132,
+ "loss": 0.14311420917510986,
+ "mean_token_accuracy": 0.9514068141579628,
+ "num_tokens": 4905151.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.224159402241594,
+ "eval_entropy": 0.33086285835435225,
+ "eval_loss": 0.6676449179649353,
+ "eval_mean_token_accuracy": 0.8505287662495015,
+ "eval_num_tokens": 4905151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 2100
+ },
+ {
+ "entropy": 0.2180163251236081,
+ "epoch": 5.273972602739726,
+ "grad_norm": 0.6703007221221924,
+ "learning_rate": 0.00012216836658457075,
+ "loss": 0.14803968667984008,
+ "mean_token_accuracy": 0.9521303348243236,
+ "num_tokens": 4947072.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.273972602739726,
+ "eval_entropy": 0.33162341708707255,
+ "eval_loss": 0.6658875942230225,
+ "eval_mean_token_accuracy": 0.8500757605530495,
+ "eval_num_tokens": 4947072.0,
+ "eval_runtime": 86.6296,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 2120
+ },
+ {
+ "entropy": 0.22511130161583423,
+ "epoch": 5.323785803237858,
+ "grad_norm": 0.8078880906105042,
+ "learning_rate": 0.00012020853317401455,
+ "loss": 0.15228408575057983,
+ "mean_token_accuracy": 0.947144789993763,
+ "num_tokens": 4991974.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.323785803237858,
+ "eval_entropy": 0.3354601170434508,
+ "eval_loss": 0.6677829623222351,
+ "eval_mean_token_accuracy": 0.8482600024273229,
+ "eval_num_tokens": 4991974.0,
+ "eval_runtime": 86.4689,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.989,
+ "step": 2140
+ },
+ {
+ "entropy": 0.2244176059961319,
+ "epoch": 5.37359900373599,
+ "grad_norm": 0.9636075496673584,
+ "learning_rate": 0.00011824656790837037,
+ "loss": 0.15260883569717407,
+ "mean_token_accuracy": 0.9471467643976211,
+ "num_tokens": 5038400.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.37359900373599,
+ "eval_entropy": 0.3381616926297199,
+ "eval_loss": 0.6694412231445312,
+ "eval_mean_token_accuracy": 0.8482369603805764,
+ "eval_num_tokens": 5038400.0,
+ "eval_runtime": 86.4147,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 2160
+ },
+ {
+ "entropy": 0.22982364390045404,
+ "epoch": 5.423412204234122,
+ "grad_norm": 0.775401771068573,
+ "learning_rate": 0.00011628306248960262,
+ "loss": 0.15140302181243898,
+ "mean_token_accuracy": 0.9492553934454918,
+ "num_tokens": 5083166.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.423412204234122,
+ "eval_entropy": 0.3305150235808173,
+ "eval_loss": 0.6717822551727295,
+ "eval_mean_token_accuracy": 0.8489849723355715,
+ "eval_num_tokens": 5083166.0,
+ "eval_runtime": 86.4728,
+ "eval_samples_per_second": 15.901,
+ "eval_steps_per_second": 1.989,
+ "step": 2180
+ },
+ {
+ "entropy": 0.21448935717344284,
+ "epoch": 5.473225404732254,
+ "grad_norm": 0.6575281023979187,
+ "learning_rate": 0.00011431860908416465,
+ "loss": 0.1452319622039795,
+ "mean_token_accuracy": 0.9505287684500218,
+ "num_tokens": 5135109.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.473225404732254,
+ "eval_entropy": 0.3488145174328671,
+ "eval_loss": 0.6612305641174316,
+ "eval_mean_token_accuracy": 0.8492907808963642,
+ "eval_num_tokens": 5135109.0,
+ "eval_runtime": 86.6927,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 2200
+ },
+ {
+ "entropy": 0.23091202937066554,
+ "epoch": 5.523038605230386,
+ "grad_norm": 0.8909686207771301,
+ "learning_rate": 0.00011235380014440985,
+ "loss": 0.15150139331817628,
+ "mean_token_accuracy": 0.9497875183820724,
+ "num_tokens": 5180138.0,
+ "step": 2220
+ },
+ {
+ "epoch": 5.523038605230386,
+ "eval_entropy": 0.3268539015810157,
+ "eval_loss": 0.6667542457580566,
+ "eval_mean_token_accuracy": 0.8499062903398691,
+ "eval_num_tokens": 5180138.0,
+ "eval_runtime": 86.4644,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 2220
+ },
+ {
+ "entropy": 0.2227974807843566,
+ "epoch": 5.572851805728518,
+ "grad_norm": 0.6180275082588196,
+ "learning_rate": 0.0001103892282299158,
+ "loss": 0.1491069197654724,
+ "mean_token_accuracy": 0.9488144010305405,
+ "num_tokens": 5226864.0,
+ "step": 2240
+ },
+ {
+ "epoch": 5.572851805728518,
+ "eval_entropy": 0.3346347655494546,
+ "eval_loss": 0.6665948629379272,
+ "eval_mean_token_accuracy": 0.8499961893918903,
+ "eval_num_tokens": 5226864.0,
+ "eval_runtime": 87.0548,
+ "eval_samples_per_second": 15.795,
+ "eval_steps_per_second": 1.976,
+ "step": 2240
+ },
+ {
+ "entropy": 0.21368421968072654,
+ "epoch": 5.62266500622665,
+ "grad_norm": 0.6004369258880615,
+ "learning_rate": 0.00010842548582877651,
+ "loss": 0.14485255479812623,
+ "mean_token_accuracy": 0.9502056457102299,
+ "num_tokens": 5276602.0,
+ "step": 2260
+ },
+ {
+ "epoch": 5.62266500622665,
+ "eval_entropy": 0.32753298804163933,
+ "eval_loss": 0.6680151224136353,
+ "eval_mean_token_accuracy": 0.8515451086121936,
+ "eval_num_tokens": 5276602.0,
+ "eval_runtime": 86.8524,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.98,
+ "step": 2260
+ },
+ {
+ "entropy": 0.2103635374456644,
+ "epoch": 5.672478206724782,
+ "grad_norm": 0.699174702167511,
+ "learning_rate": 0.00010646316517891613,
+ "loss": 0.14297772645950318,
+ "mean_token_accuracy": 0.9512537539005279,
+ "num_tokens": 5323718.0,
+ "step": 2280
+ },
+ {
+ "epoch": 5.672478206724782,
+ "eval_entropy": 0.32966585959806,
+ "eval_loss": 0.675578773021698,
+ "eval_mean_token_accuracy": 0.8509623023659684,
+ "eval_num_tokens": 5323718.0,
+ "eval_runtime": 86.4518,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2280
+ },
+ {
+ "entropy": 0.22516900151968003,
+ "epoch": 5.722291407222914,
+ "grad_norm": 0.6637354493141174,
+ "learning_rate": 0.00010450285808947797,
+ "loss": 0.15202572345733642,
+ "mean_token_accuracy": 0.9482452072203159,
+ "num_tokens": 5369039.0,
+ "step": 2300
+ },
+ {
+ "epoch": 5.722291407222914,
+ "eval_entropy": 0.3369456917740578,
+ "eval_loss": 0.6697061061859131,
+ "eval_mean_token_accuracy": 0.848603522361711,
+ "eval_num_tokens": 5369039.0,
+ "eval_runtime": 86.6371,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.985,
+ "step": 2300
+ },
+ {
+ "entropy": 0.21841065725311637,
+ "epoch": 5.772104607721046,
+ "grad_norm": 0.7940268516540527,
+ "learning_rate": 0.00010254515576234297,
+ "loss": 0.14710167646408082,
+ "mean_token_accuracy": 0.9493498183786869,
+ "num_tokens": 5417029.0,
+ "step": 2320
+ },
+ {
+ "epoch": 5.772104607721046,
+ "eval_entropy": 0.3237486180177955,
+ "eval_loss": 0.6779657602310181,
+ "eval_mean_token_accuracy": 0.8500715313955794,
+ "eval_num_tokens": 5417029.0,
+ "eval_runtime": 86.1826,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 1.996,
+ "step": 2320
+ },
+ {
+ "entropy": 0.22146204356104135,
+ "epoch": 5.821917808219178,
+ "grad_norm": 0.9234833121299744,
+ "learning_rate": 0.00010059064861383132,
+ "loss": 0.14720046520233154,
+ "mean_token_accuracy": 0.9493872679769992,
+ "num_tokens": 5461671.0,
+ "step": 2340
+ },
+ {
+ "epoch": 5.821917808219178,
+ "eval_entropy": 0.32365207564692167,
+ "eval_loss": 0.6704005002975464,
+ "eval_mean_token_accuracy": 0.8507985760306203,
+ "eval_num_tokens": 5461671.0,
+ "eval_runtime": 86.5494,
+ "eval_samples_per_second": 15.887,
+ "eval_steps_per_second": 1.987,
+ "step": 2340
+ },
+ {
+ "entropy": 0.20934011954814197,
+ "epoch": 5.87173100871731,
+ "grad_norm": 0.5547503232955933,
+ "learning_rate": 9.863992609664084e-05,
+ "loss": 0.1464867353439331,
+ "mean_token_accuracy": 0.9503875687718392,
+ "num_tokens": 5509312.0,
+ "step": 2360
+ },
+ {
+ "epoch": 5.87173100871731,
+ "eval_entropy": 0.3330401429083458,
+ "eval_loss": 0.6659091114997864,
+ "eval_mean_token_accuracy": 0.8504848906467127,
+ "eval_num_tokens": 5509312.0,
+ "eval_runtime": 86.5855,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 2360
+ },
+ {
+ "entropy": 0.21678635366261007,
+ "epoch": 5.921544209215442,
+ "grad_norm": 0.570612907409668,
+ "learning_rate": 9.669357652207635e-05,
+ "loss": 0.14821385145187377,
+ "mean_token_accuracy": 0.9503940217196941,
+ "num_tokens": 5558196.0,
+ "step": 2380
+ },
+ {
+ "epoch": 5.921544209215442,
+ "eval_entropy": 0.3322022325077722,
+ "eval_loss": 0.6722489595413208,
+ "eval_mean_token_accuracy": 0.8489979422369669,
+ "eval_num_tokens": 5558196.0,
+ "eval_runtime": 86.2986,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 2380
+ },
+ {
+ "entropy": 0.20932920072227718,
+ "epoch": 5.971357409713574,
+ "grad_norm": 0.7879557609558105,
+ "learning_rate": 9.475218688262262e-05,
+ "loss": 0.14675841331481934,
+ "mean_token_accuracy": 0.9507176131010056,
+ "num_tokens": 5605400.0,
+ "step": 2400
+ },
+ {
+ "epoch": 5.971357409713574,
+ "eval_entropy": 0.3199348642902319,
+ "eval_loss": 0.6698136329650879,
+ "eval_mean_token_accuracy": 0.8514142130003419,
+ "eval_num_tokens": 5605400.0,
+ "eval_runtime": 85.8995,
+ "eval_samples_per_second": 16.007,
+ "eval_steps_per_second": 2.002,
+ "step": 2400
+ },
+ {
+ "entropy": 0.21032143919131693,
+ "epoch": 6.019925280199253,
+ "grad_norm": 0.5823076367378235,
+ "learning_rate": 9.281634267491569e-05,
+ "loss": 0.13322267532348633,
+ "mean_token_accuracy": 0.9550939072401096,
+ "num_tokens": 5648968.0,
+ "step": 2420
+ },
+ {
+ "epoch": 6.019925280199253,
+ "eval_entropy": 0.30206270117399303,
+ "eval_loss": 0.7093168497085571,
+ "eval_mean_token_accuracy": 0.8500627639681794,
+ "eval_num_tokens": 5648968.0,
+ "eval_runtime": 85.8128,
+ "eval_samples_per_second": 16.023,
+ "eval_steps_per_second": 2.004,
+ "step": 2420
+ },
+ {
+ "entropy": 0.1534628233872354,
+ "epoch": 6.069738480697385,
+ "grad_norm": 0.710133969783783,
+ "learning_rate": 9.088662772316508e-05,
+ "loss": 0.09078952670097351,
+ "mean_token_accuracy": 0.9678447999060154,
+ "num_tokens": 5697633.0,
+ "step": 2440
+ },
+ {
+ "epoch": 6.069738480697385,
+ "eval_entropy": 0.28208133101809857,
+ "eval_loss": 0.7636417150497437,
+ "eval_mean_token_accuracy": 0.8494061477655588,
+ "eval_num_tokens": 5697633.0,
+ "eval_runtime": 85.9724,
+ "eval_samples_per_second": 15.994,
+ "eval_steps_per_second": 2.001,
+ "step": 2440
+ },
+ {
+ "entropy": 0.16151462448760867,
+ "epoch": 6.119551681195516,
+ "grad_norm": 0.5793812274932861,
+ "learning_rate": 8.896362400308028e-05,
+ "loss": 0.09545697569847107,
+ "mean_token_accuracy": 0.9671573750674725,
+ "num_tokens": 5745090.0,
+ "step": 2460
+ },
+ {
+ "epoch": 6.119551681195516,
+ "eval_entropy": 0.2833245605403601,
+ "eval_loss": 0.7402405738830566,
+ "eval_mean_token_accuracy": 0.8503523728875226,
+ "eval_num_tokens": 5745090.0,
+ "eval_runtime": 85.5461,
+ "eval_samples_per_second": 16.073,
+ "eval_steps_per_second": 2.011,
+ "step": 2460
+ },
+ {
+ "entropy": 0.15203177919611335,
+ "epoch": 6.169364881693649,
+ "grad_norm": 0.4251123368740082,
+ "learning_rate": 8.704791146635483e-05,
+ "loss": 0.09420782327651978,
+ "mean_token_accuracy": 0.9677386932075024,
+ "num_tokens": 5790333.0,
+ "step": 2480
+ },
+ {
+ "epoch": 6.169364881693649,
+ "eval_entropy": 0.28572545962971313,
+ "eval_loss": 0.735416829586029,
+ "eval_mean_token_accuracy": 0.8487084663884584,
+ "eval_num_tokens": 5790333.0,
+ "eval_runtime": 85.4801,
+ "eval_samples_per_second": 16.086,
+ "eval_steps_per_second": 2.012,
+ "step": 2480
+ },
+ {
+ "entropy": 0.15587336672469973,
+ "epoch": 6.219178082191781,
+ "grad_norm": 0.4357028007507324,
+ "learning_rate": 8.514006786576085e-05,
+ "loss": 0.09429320096969604,
+ "mean_token_accuracy": 0.9682952925562859,
+ "num_tokens": 5837321.0,
+ "step": 2500
+ },
+ {
+ "epoch": 6.219178082191781,
+ "eval_entropy": 0.2859006894882335,
+ "eval_loss": 0.7347224950790405,
+ "eval_mean_token_accuracy": 0.8501905518215757,
+ "eval_num_tokens": 5837321.0,
+ "eval_runtime": 85.7578,
+ "eval_samples_per_second": 16.034,
+ "eval_steps_per_second": 2.006,
+ "step": 2500
+ },
+ {
+ "entropy": 0.15765639198943973,
+ "epoch": 6.268991282689913,
+ "grad_norm": 0.47331130504608154,
+ "learning_rate": 8.324066858090663e-05,
+ "loss": 0.09571113586425781,
+ "mean_token_accuracy": 0.9683481335639954,
+ "num_tokens": 5884398.0,
+ "step": 2520
+ },
+ {
+ "epoch": 6.268991282689913,
+ "eval_entropy": 0.29231513846059176,
+ "eval_loss": 0.7392512559890747,
+ "eval_mean_token_accuracy": 0.8486633983462356,
+ "eval_num_tokens": 5884398.0,
+ "eval_runtime": 85.7846,
+ "eval_samples_per_second": 16.029,
+ "eval_steps_per_second": 2.005,
+ "step": 2520
+ },
+ {
+ "entropy": 0.16176860257983208,
+ "epoch": 6.318804483188045,
+ "grad_norm": 0.6142018437385559,
+ "learning_rate": 8.135028644470992e-05,
+ "loss": 0.09486144185066223,
+ "mean_token_accuracy": 0.9682316601276397,
+ "num_tokens": 5929876.0,
+ "step": 2540
+ },
+ {
+ "epoch": 6.318804483188045,
+ "eval_entropy": 0.2851274753379267,
+ "eval_loss": 0.7520816922187805,
+ "eval_mean_token_accuracy": 0.8501113649717597,
+ "eval_num_tokens": 5929876.0,
+ "eval_runtime": 85.9425,
+ "eval_samples_per_second": 15.999,
+ "eval_steps_per_second": 2.001,
+ "step": 2540
+ },
+ {
+ "entropy": 0.15404034564271568,
+ "epoch": 6.3686176836861765,
+ "grad_norm": 0.6051287651062012,
+ "learning_rate": 7.946949157063964e-05,
+ "loss": 0.09280472993850708,
+ "mean_token_accuracy": 0.9684635892510414,
+ "num_tokens": 5978490.0,
+ "step": 2560
+ },
+ {
+ "epoch": 6.3686176836861765,
+ "eval_entropy": 0.28802703563557114,
+ "eval_loss": 0.7439162135124207,
+ "eval_mean_token_accuracy": 0.8499851770872293,
+ "eval_num_tokens": 5978490.0,
+ "eval_runtime": 86.0703,
+ "eval_samples_per_second": 15.975,
+ "eval_steps_per_second": 1.998,
+ "step": 2560
+ },
+ {
+ "entropy": 0.15343588953837753,
+ "epoch": 6.418430884184309,
+ "grad_norm": 0.4823743402957916,
+ "learning_rate": 7.759885118077701e-05,
+ "loss": 0.09000591039657593,
+ "mean_token_accuracy": 0.9699928767979145,
+ "num_tokens": 6025380.0,
+ "step": 2580
+ },
+ {
+ "epoch": 6.418430884184309,
+ "eval_entropy": 0.2795634938533916,
+ "eval_loss": 0.7647850513458252,
+ "eval_mean_token_accuracy": 0.8503464397995971,
+ "eval_num_tokens": 6025380.0,
+ "eval_runtime": 85.8886,
+ "eval_samples_per_second": 16.009,
+ "eval_steps_per_second": 2.003,
+ "step": 2580
+ },
+ {
+ "entropy": 0.15740026142448188,
+ "epoch": 6.468244084682441,
+ "grad_norm": 0.5082696676254272,
+ "learning_rate": 7.57389294347494e-05,
+ "loss": 0.09191849827766418,
+ "mean_token_accuracy": 0.9692809768021107,
+ "num_tokens": 6073349.0,
+ "step": 2600
+ },
+ {
+ "epoch": 6.468244084682441,
+ "eval_entropy": 0.2913342311458532,
+ "eval_loss": 0.7518694996833801,
+ "eval_mean_token_accuracy": 0.8483168302580367,
+ "eval_num_tokens": 6073349.0,
+ "eval_runtime": 85.5761,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.01,
+ "step": 2600
+ },
+ {
+ "entropy": 0.15922069251537324,
+ "epoch": 6.518057285180573,
+ "grad_norm": 0.3995199501514435,
+ "learning_rate": 7.389028725958736e-05,
+ "loss": 0.09584367871284485,
+ "mean_token_accuracy": 0.9685114495456218,
+ "num_tokens": 6118148.0,
+ "step": 2620
+ },
+ {
+ "epoch": 6.518057285180573,
+ "eval_entropy": 0.2863075934177221,
+ "eval_loss": 0.7539381384849548,
+ "eval_mean_token_accuracy": 0.8507507083027862,
+ "eval_num_tokens": 6118148.0,
+ "eval_runtime": 86.112,
+ "eval_samples_per_second": 15.968,
+ "eval_steps_per_second": 1.997,
+ "step": 2620
+ },
+ {
+ "entropy": 0.16197575423866512,
+ "epoch": 6.567870485678705,
+ "grad_norm": 0.534295380115509,
+ "learning_rate": 7.205348218055678e-05,
+ "loss": 0.0961170256137848,
+ "mean_token_accuracy": 0.9674530044198036,
+ "num_tokens": 6165523.0,
+ "step": 2640
+ },
+ {
+ "epoch": 6.567870485678705,
+ "eval_entropy": 0.29021967315050057,
+ "eval_loss": 0.751198947429657,
+ "eval_mean_token_accuracy": 0.8509796344956686,
+ "eval_num_tokens": 6165523.0,
+ "eval_runtime": 85.7958,
+ "eval_samples_per_second": 16.026,
+ "eval_steps_per_second": 2.005,
+ "step": 2640
+ },
+ {
+ "entropy": 0.15261746793985367,
+ "epoch": 6.617683686176837,
+ "grad_norm": 0.5391237139701843,
+ "learning_rate": 7.022906815301673e-05,
+ "loss": 0.0926026999950409,
+ "mean_token_accuracy": 0.9695659473538398,
+ "num_tokens": 6216232.0,
+ "step": 2660
+ },
+ {
+ "epoch": 6.617683686176837,
+ "eval_entropy": 0.29128045216202736,
+ "eval_loss": 0.7450292110443115,
+ "eval_mean_token_accuracy": 0.8498771443616512,
+ "eval_num_tokens": 6216232.0,
+ "eval_runtime": 86.3963,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 2660
+ },
+ {
+ "entropy": 0.16164180357009172,
+ "epoch": 6.667496886674969,
+ "grad_norm": 0.5767946243286133,
+ "learning_rate": 6.841759539535419e-05,
+ "loss": 0.09291981458663941,
+ "mean_token_accuracy": 0.9687136687338352,
+ "num_tokens": 6264807.0,
+ "step": 2680
+ },
+ {
+ "epoch": 6.667496886674969,
+ "eval_entropy": 0.2897637223088464,
+ "eval_loss": 0.7503410577774048,
+ "eval_mean_token_accuracy": 0.8503315164599308,
+ "eval_num_tokens": 6264807.0,
+ "eval_runtime": 86.0653,
+ "eval_samples_per_second": 15.976,
+ "eval_steps_per_second": 1.998,
+ "step": 2680
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.6436423595865088e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2700/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2700/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2700/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2700/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2700/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2700/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2700/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2700/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2700/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2700/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2700/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2700/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2700/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2700/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..66fd3bfbf40cc53c12d8b221135a9e64d58c8a4c
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2700/trainer_state.json
@@ -0,0 +1,2869 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 6.717310087173101,
+ "eval_steps": 20,
+ "global_step": 2700,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ },
+ {
+ "entropy": 0.3193941755220294,
+ "epoch": 4.5280199252802,
+ "grad_norm": 0.8281906843185425,
+ "learning_rate": 0.0001509111761786888,
+ "loss": 0.23936262130737304,
+ "mean_token_accuracy": 0.9201708927750587,
+ "num_tokens": 4244423.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.5280199252802,
+ "eval_entropy": 0.38704028864239537,
+ "eval_loss": 0.6006569266319275,
+ "eval_mean_token_accuracy": 0.8502406720505205,
+ "eval_num_tokens": 4244423.0,
+ "eval_runtime": 86.8059,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1820
+ },
+ {
+ "entropy": 0.3164879363030195,
+ "epoch": 4.577833125778331,
+ "grad_norm": 0.7892968654632568,
+ "learning_rate": 0.00014905346557909867,
+ "loss": 0.24541733264923096,
+ "mean_token_accuracy": 0.9175932116806507,
+ "num_tokens": 4289773.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.577833125778331,
+ "eval_entropy": 0.38861122120951497,
+ "eval_loss": 0.6115967631340027,
+ "eval_mean_token_accuracy": 0.849471275196519,
+ "eval_num_tokens": 4289773.0,
+ "eval_runtime": 86.2946,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1840
+ },
+ {
+ "entropy": 0.3051785985007882,
+ "epoch": 4.627646326276463,
+ "grad_norm": 0.8109654188156128,
+ "learning_rate": 0.0001471849238862319,
+ "loss": 0.23433220386505127,
+ "mean_token_accuracy": 0.9206570319831371,
+ "num_tokens": 4336894.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.627646326276463,
+ "eval_entropy": 0.37162452295076015,
+ "eval_loss": 0.6184061765670776,
+ "eval_mean_token_accuracy": 0.8501173268223918,
+ "eval_num_tokens": 4336894.0,
+ "eval_runtime": 86.6865,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1860
+ },
+ {
+ "entropy": 0.3168198253959417,
+ "epoch": 4.677459526774595,
+ "grad_norm": 0.9512342214584351,
+ "learning_rate": 0.0001453061146267775,
+ "loss": 0.23832404613494873,
+ "mean_token_accuracy": 0.9197044663131237,
+ "num_tokens": 4382947.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.677459526774595,
+ "eval_entropy": 0.3845940856912801,
+ "eval_loss": 0.606762707233429,
+ "eval_mean_token_accuracy": 0.8504838194957999,
+ "eval_num_tokens": 4382947.0,
+ "eval_runtime": 86.5175,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 1880
+ },
+ {
+ "entropy": 0.30791807882487776,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 0.8123113512992859,
+ "learning_rate": 0.00014341760442398248,
+ "loss": 0.2395785331726074,
+ "mean_token_accuracy": 0.918928150832653,
+ "num_tokens": 4433050.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.7272727272727275,
+ "eval_entropy": 0.39762327222283494,
+ "eval_loss": 0.5994202494621277,
+ "eval_mean_token_accuracy": 0.8509274201337681,
+ "eval_num_tokens": 4433050.0,
+ "eval_runtime": 86.2873,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.993,
+ "step": 1900
+ },
+ {
+ "entropy": 0.3021434534341097,
+ "epoch": 4.777085927770859,
+ "grad_norm": 0.731787383556366,
+ "learning_rate": 0.000141519962826766,
+ "loss": 0.23494718074798585,
+ "mean_token_accuracy": 0.9201403826475143,
+ "num_tokens": 4483598.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.777085927770859,
+ "eval_entropy": 0.3827026732439219,
+ "eval_loss": 0.5995895862579346,
+ "eval_mean_token_accuracy": 0.851468373523202,
+ "eval_num_tokens": 4483598.0,
+ "eval_runtime": 86.3006,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 1920
+ },
+ {
+ "entropy": 0.31626159623265265,
+ "epoch": 4.826899128268991,
+ "grad_norm": 0.8848487138748169,
+ "learning_rate": 0.00013961376213795132,
+ "loss": 0.2439030647277832,
+ "mean_token_accuracy": 0.9196575872600079,
+ "num_tokens": 4529201.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.826899128268991,
+ "eval_entropy": 0.388698436839636,
+ "eval_loss": 0.6000174283981323,
+ "eval_mean_token_accuracy": 0.8518068187458571,
+ "eval_num_tokens": 4529201.0,
+ "eval_runtime": 86.8979,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.979,
+ "step": 1940
+ },
+ {
+ "entropy": 0.30520407035946845,
+ "epoch": 4.876712328767123,
+ "grad_norm": 0.8532460927963257,
+ "learning_rate": 0.00013769957724166695,
+ "loss": 0.23458616733551024,
+ "mean_token_accuracy": 0.9221912942826748,
+ "num_tokens": 4578167.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.876712328767123,
+ "eval_entropy": 0.38777847102908203,
+ "eval_loss": 0.6004981398582458,
+ "eval_mean_token_accuracy": 0.8516481768253238,
+ "eval_num_tokens": 4578167.0,
+ "eval_runtime": 87.0777,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.975,
+ "step": 1960
+ },
+ {
+ "entropy": 0.3226448342204094,
+ "epoch": 4.926525529265255,
+ "grad_norm": 0.6945561766624451,
+ "learning_rate": 0.0001357779854299694,
+ "loss": 0.24048397541046143,
+ "mean_token_accuracy": 0.9195300146937371,
+ "num_tokens": 4622316.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.926525529265255,
+ "eval_entropy": 0.38581624263247777,
+ "eval_loss": 0.6029234528541565,
+ "eval_mean_token_accuracy": 0.8514213260523108,
+ "eval_num_tokens": 4622316.0,
+ "eval_runtime": 85.8729,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 1980
+ },
+ {
+ "entropy": 0.3051655298098922,
+ "epoch": 4.976338729763388,
+ "grad_norm": 0.7976452708244324,
+ "learning_rate": 0.00013384956622874001,
+ "loss": 0.23584742546081544,
+ "mean_token_accuracy": 0.9216851457953453,
+ "num_tokens": 4670746.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.976338729763388,
+ "eval_entropy": 0.37913159246361533,
+ "eval_loss": 0.6057604551315308,
+ "eval_mean_token_accuracy": 0.8525801203971686,
+ "eval_num_tokens": 4670746.0,
+ "eval_runtime": 86.1145,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2000
+ },
+ {
+ "entropy": 0.27438195240803254,
+ "epoch": 5.024906600249066,
+ "grad_norm": 0.6729586124420166,
+ "learning_rate": 0.0001319149012229075,
+ "loss": 0.19775952100753785,
+ "mean_token_accuracy": 0.9339428559327737,
+ "num_tokens": 4716176.0,
+ "step": 2020
+ },
+ {
+ "epoch": 5.024906600249066,
+ "eval_entropy": 0.3448961910813354,
+ "eval_loss": 0.6750120520591736,
+ "eval_mean_token_accuracy": 0.8487970232963562,
+ "eval_num_tokens": 4716176.0,
+ "eval_runtime": 86.1169,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2020
+ },
+ {
+ "entropy": 0.21423916313797237,
+ "epoch": 5.074719800747198,
+ "grad_norm": 0.6934391856193542,
+ "learning_rate": 0.00012997457388105022,
+ "loss": 0.1439570426940918,
+ "mean_token_accuracy": 0.9528236843645572,
+ "num_tokens": 4763269.0,
+ "step": 2040
+ },
+ {
+ "epoch": 5.074719800747198,
+ "eval_entropy": 0.3570949243771475,
+ "eval_loss": 0.6465504169464111,
+ "eval_mean_token_accuracy": 0.8490785547467166,
+ "eval_num_tokens": 4763269.0,
+ "eval_runtime": 85.9574,
+ "eval_samples_per_second": 15.996,
+ "eval_steps_per_second": 2.001,
+ "step": 2040
+ },
+ {
+ "entropy": 0.20838565267622472,
+ "epoch": 5.12453300124533,
+ "grad_norm": 0.7286986112594604,
+ "learning_rate": 0.00012802916937942972,
+ "loss": 0.14467307329177856,
+ "mean_token_accuracy": 0.950994835793972,
+ "num_tokens": 4809047.0,
+ "step": 2060
+ },
+ {
+ "epoch": 5.12453300124533,
+ "eval_entropy": 0.3452463157821533,
+ "eval_loss": 0.6705958843231201,
+ "eval_mean_token_accuracy": 0.8490352796953778,
+ "eval_num_tokens": 4809047.0,
+ "eval_runtime": 86.228,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 2060
+ },
+ {
+ "entropy": 0.20453082229942082,
+ "epoch": 5.174346201743462,
+ "grad_norm": 0.7515555620193481,
+ "learning_rate": 0.00012607927442550974,
+ "loss": 0.13732000589370727,
+ "mean_token_accuracy": 0.9537357829511166,
+ "num_tokens": 4857965.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.174346201743462,
+ "eval_entropy": 0.32431264914745506,
+ "eval_loss": 0.6743043065071106,
+ "eval_mean_token_accuracy": 0.8504878629085629,
+ "eval_num_tokens": 4857965.0,
+ "eval_runtime": 86.5948,
+ "eval_samples_per_second": 15.879,
+ "eval_steps_per_second": 1.986,
+ "step": 2080
+ },
+ {
+ "entropy": 0.21812320686876774,
+ "epoch": 5.224159402241594,
+ "grad_norm": 0.9093465209007263,
+ "learning_rate": 0.0001241254770810132,
+ "loss": 0.14311420917510986,
+ "mean_token_accuracy": 0.9514068141579628,
+ "num_tokens": 4905151.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.224159402241594,
+ "eval_entropy": 0.33086285835435225,
+ "eval_loss": 0.6676449179649353,
+ "eval_mean_token_accuracy": 0.8505287662495015,
+ "eval_num_tokens": 4905151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 2100
+ },
+ {
+ "entropy": 0.2180163251236081,
+ "epoch": 5.273972602739726,
+ "grad_norm": 0.6703007221221924,
+ "learning_rate": 0.00012216836658457075,
+ "loss": 0.14803968667984008,
+ "mean_token_accuracy": 0.9521303348243236,
+ "num_tokens": 4947072.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.273972602739726,
+ "eval_entropy": 0.33162341708707255,
+ "eval_loss": 0.6658875942230225,
+ "eval_mean_token_accuracy": 0.8500757605530495,
+ "eval_num_tokens": 4947072.0,
+ "eval_runtime": 86.6296,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 2120
+ },
+ {
+ "entropy": 0.22511130161583423,
+ "epoch": 5.323785803237858,
+ "grad_norm": 0.8078880906105042,
+ "learning_rate": 0.00012020853317401455,
+ "loss": 0.15228408575057983,
+ "mean_token_accuracy": 0.947144789993763,
+ "num_tokens": 4991974.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.323785803237858,
+ "eval_entropy": 0.3354601170434508,
+ "eval_loss": 0.6677829623222351,
+ "eval_mean_token_accuracy": 0.8482600024273229,
+ "eval_num_tokens": 4991974.0,
+ "eval_runtime": 86.4689,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.989,
+ "step": 2140
+ },
+ {
+ "entropy": 0.2244176059961319,
+ "epoch": 5.37359900373599,
+ "grad_norm": 0.9636075496673584,
+ "learning_rate": 0.00011824656790837037,
+ "loss": 0.15260883569717407,
+ "mean_token_accuracy": 0.9471467643976211,
+ "num_tokens": 5038400.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.37359900373599,
+ "eval_entropy": 0.3381616926297199,
+ "eval_loss": 0.6694412231445312,
+ "eval_mean_token_accuracy": 0.8482369603805764,
+ "eval_num_tokens": 5038400.0,
+ "eval_runtime": 86.4147,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 2160
+ },
+ {
+ "entropy": 0.22982364390045404,
+ "epoch": 5.423412204234122,
+ "grad_norm": 0.775401771068573,
+ "learning_rate": 0.00011628306248960262,
+ "loss": 0.15140302181243898,
+ "mean_token_accuracy": 0.9492553934454918,
+ "num_tokens": 5083166.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.423412204234122,
+ "eval_entropy": 0.3305150235808173,
+ "eval_loss": 0.6717822551727295,
+ "eval_mean_token_accuracy": 0.8489849723355715,
+ "eval_num_tokens": 5083166.0,
+ "eval_runtime": 86.4728,
+ "eval_samples_per_second": 15.901,
+ "eval_steps_per_second": 1.989,
+ "step": 2180
+ },
+ {
+ "entropy": 0.21448935717344284,
+ "epoch": 5.473225404732254,
+ "grad_norm": 0.6575281023979187,
+ "learning_rate": 0.00011431860908416465,
+ "loss": 0.1452319622039795,
+ "mean_token_accuracy": 0.9505287684500218,
+ "num_tokens": 5135109.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.473225404732254,
+ "eval_entropy": 0.3488145174328671,
+ "eval_loss": 0.6612305641174316,
+ "eval_mean_token_accuracy": 0.8492907808963642,
+ "eval_num_tokens": 5135109.0,
+ "eval_runtime": 86.6927,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 2200
+ },
+ {
+ "entropy": 0.23091202937066554,
+ "epoch": 5.523038605230386,
+ "grad_norm": 0.8909686207771301,
+ "learning_rate": 0.00011235380014440985,
+ "loss": 0.15150139331817628,
+ "mean_token_accuracy": 0.9497875183820724,
+ "num_tokens": 5180138.0,
+ "step": 2220
+ },
+ {
+ "epoch": 5.523038605230386,
+ "eval_entropy": 0.3268539015810157,
+ "eval_loss": 0.6667542457580566,
+ "eval_mean_token_accuracy": 0.8499062903398691,
+ "eval_num_tokens": 5180138.0,
+ "eval_runtime": 86.4644,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 2220
+ },
+ {
+ "entropy": 0.2227974807843566,
+ "epoch": 5.572851805728518,
+ "grad_norm": 0.6180275082588196,
+ "learning_rate": 0.0001103892282299158,
+ "loss": 0.1491069197654724,
+ "mean_token_accuracy": 0.9488144010305405,
+ "num_tokens": 5226864.0,
+ "step": 2240
+ },
+ {
+ "epoch": 5.572851805728518,
+ "eval_entropy": 0.3346347655494546,
+ "eval_loss": 0.6665948629379272,
+ "eval_mean_token_accuracy": 0.8499961893918903,
+ "eval_num_tokens": 5226864.0,
+ "eval_runtime": 87.0548,
+ "eval_samples_per_second": 15.795,
+ "eval_steps_per_second": 1.976,
+ "step": 2240
+ },
+ {
+ "entropy": 0.21368421968072654,
+ "epoch": 5.62266500622665,
+ "grad_norm": 0.6004369258880615,
+ "learning_rate": 0.00010842548582877651,
+ "loss": 0.14485255479812623,
+ "mean_token_accuracy": 0.9502056457102299,
+ "num_tokens": 5276602.0,
+ "step": 2260
+ },
+ {
+ "epoch": 5.62266500622665,
+ "eval_entropy": 0.32753298804163933,
+ "eval_loss": 0.6680151224136353,
+ "eval_mean_token_accuracy": 0.8515451086121936,
+ "eval_num_tokens": 5276602.0,
+ "eval_runtime": 86.8524,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.98,
+ "step": 2260
+ },
+ {
+ "entropy": 0.2103635374456644,
+ "epoch": 5.672478206724782,
+ "grad_norm": 0.699174702167511,
+ "learning_rate": 0.00010646316517891613,
+ "loss": 0.14297772645950318,
+ "mean_token_accuracy": 0.9512537539005279,
+ "num_tokens": 5323718.0,
+ "step": 2280
+ },
+ {
+ "epoch": 5.672478206724782,
+ "eval_entropy": 0.32966585959806,
+ "eval_loss": 0.675578773021698,
+ "eval_mean_token_accuracy": 0.8509623023659684,
+ "eval_num_tokens": 5323718.0,
+ "eval_runtime": 86.4518,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2280
+ },
+ {
+ "entropy": 0.22516900151968003,
+ "epoch": 5.722291407222914,
+ "grad_norm": 0.6637354493141174,
+ "learning_rate": 0.00010450285808947797,
+ "loss": 0.15202572345733642,
+ "mean_token_accuracy": 0.9482452072203159,
+ "num_tokens": 5369039.0,
+ "step": 2300
+ },
+ {
+ "epoch": 5.722291407222914,
+ "eval_entropy": 0.3369456917740578,
+ "eval_loss": 0.6697061061859131,
+ "eval_mean_token_accuracy": 0.848603522361711,
+ "eval_num_tokens": 5369039.0,
+ "eval_runtime": 86.6371,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.985,
+ "step": 2300
+ },
+ {
+ "entropy": 0.21841065725311637,
+ "epoch": 5.772104607721046,
+ "grad_norm": 0.7940268516540527,
+ "learning_rate": 0.00010254515576234297,
+ "loss": 0.14710167646408082,
+ "mean_token_accuracy": 0.9493498183786869,
+ "num_tokens": 5417029.0,
+ "step": 2320
+ },
+ {
+ "epoch": 5.772104607721046,
+ "eval_entropy": 0.3237486180177955,
+ "eval_loss": 0.6779657602310181,
+ "eval_mean_token_accuracy": 0.8500715313955794,
+ "eval_num_tokens": 5417029.0,
+ "eval_runtime": 86.1826,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 1.996,
+ "step": 2320
+ },
+ {
+ "entropy": 0.22146204356104135,
+ "epoch": 5.821917808219178,
+ "grad_norm": 0.9234833121299744,
+ "learning_rate": 0.00010059064861383132,
+ "loss": 0.14720046520233154,
+ "mean_token_accuracy": 0.9493872679769992,
+ "num_tokens": 5461671.0,
+ "step": 2340
+ },
+ {
+ "epoch": 5.821917808219178,
+ "eval_entropy": 0.32365207564692167,
+ "eval_loss": 0.6704005002975464,
+ "eval_mean_token_accuracy": 0.8507985760306203,
+ "eval_num_tokens": 5461671.0,
+ "eval_runtime": 86.5494,
+ "eval_samples_per_second": 15.887,
+ "eval_steps_per_second": 1.987,
+ "step": 2340
+ },
+ {
+ "entropy": 0.20934011954814197,
+ "epoch": 5.87173100871731,
+ "grad_norm": 0.5547503232955933,
+ "learning_rate": 9.863992609664084e-05,
+ "loss": 0.1464867353439331,
+ "mean_token_accuracy": 0.9503875687718392,
+ "num_tokens": 5509312.0,
+ "step": 2360
+ },
+ {
+ "epoch": 5.87173100871731,
+ "eval_entropy": 0.3330401429083458,
+ "eval_loss": 0.6659091114997864,
+ "eval_mean_token_accuracy": 0.8504848906467127,
+ "eval_num_tokens": 5509312.0,
+ "eval_runtime": 86.5855,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 2360
+ },
+ {
+ "entropy": 0.21678635366261007,
+ "epoch": 5.921544209215442,
+ "grad_norm": 0.570612907409668,
+ "learning_rate": 9.669357652207635e-05,
+ "loss": 0.14821385145187377,
+ "mean_token_accuracy": 0.9503940217196941,
+ "num_tokens": 5558196.0,
+ "step": 2380
+ },
+ {
+ "epoch": 5.921544209215442,
+ "eval_entropy": 0.3322022325077722,
+ "eval_loss": 0.6722489595413208,
+ "eval_mean_token_accuracy": 0.8489979422369669,
+ "eval_num_tokens": 5558196.0,
+ "eval_runtime": 86.2986,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 2380
+ },
+ {
+ "entropy": 0.20932920072227718,
+ "epoch": 5.971357409713574,
+ "grad_norm": 0.7879557609558105,
+ "learning_rate": 9.475218688262262e-05,
+ "loss": 0.14675841331481934,
+ "mean_token_accuracy": 0.9507176131010056,
+ "num_tokens": 5605400.0,
+ "step": 2400
+ },
+ {
+ "epoch": 5.971357409713574,
+ "eval_entropy": 0.3199348642902319,
+ "eval_loss": 0.6698136329650879,
+ "eval_mean_token_accuracy": 0.8514142130003419,
+ "eval_num_tokens": 5605400.0,
+ "eval_runtime": 85.8995,
+ "eval_samples_per_second": 16.007,
+ "eval_steps_per_second": 2.002,
+ "step": 2400
+ },
+ {
+ "entropy": 0.21032143919131693,
+ "epoch": 6.019925280199253,
+ "grad_norm": 0.5823076367378235,
+ "learning_rate": 9.281634267491569e-05,
+ "loss": 0.13322267532348633,
+ "mean_token_accuracy": 0.9550939072401096,
+ "num_tokens": 5648968.0,
+ "step": 2420
+ },
+ {
+ "epoch": 6.019925280199253,
+ "eval_entropy": 0.30206270117399303,
+ "eval_loss": 0.7093168497085571,
+ "eval_mean_token_accuracy": 0.8500627639681794,
+ "eval_num_tokens": 5648968.0,
+ "eval_runtime": 85.8128,
+ "eval_samples_per_second": 16.023,
+ "eval_steps_per_second": 2.004,
+ "step": 2420
+ },
+ {
+ "entropy": 0.1534628233872354,
+ "epoch": 6.069738480697385,
+ "grad_norm": 0.710133969783783,
+ "learning_rate": 9.088662772316508e-05,
+ "loss": 0.09078952670097351,
+ "mean_token_accuracy": 0.9678447999060154,
+ "num_tokens": 5697633.0,
+ "step": 2440
+ },
+ {
+ "epoch": 6.069738480697385,
+ "eval_entropy": 0.28208133101809857,
+ "eval_loss": 0.7636417150497437,
+ "eval_mean_token_accuracy": 0.8494061477655588,
+ "eval_num_tokens": 5697633.0,
+ "eval_runtime": 85.9724,
+ "eval_samples_per_second": 15.994,
+ "eval_steps_per_second": 2.001,
+ "step": 2440
+ },
+ {
+ "entropy": 0.16151462448760867,
+ "epoch": 6.119551681195516,
+ "grad_norm": 0.5793812274932861,
+ "learning_rate": 8.896362400308028e-05,
+ "loss": 0.09545697569847107,
+ "mean_token_accuracy": 0.9671573750674725,
+ "num_tokens": 5745090.0,
+ "step": 2460
+ },
+ {
+ "epoch": 6.119551681195516,
+ "eval_entropy": 0.2833245605403601,
+ "eval_loss": 0.7402405738830566,
+ "eval_mean_token_accuracy": 0.8503523728875226,
+ "eval_num_tokens": 5745090.0,
+ "eval_runtime": 85.5461,
+ "eval_samples_per_second": 16.073,
+ "eval_steps_per_second": 2.011,
+ "step": 2460
+ },
+ {
+ "entropy": 0.15203177919611335,
+ "epoch": 6.169364881693649,
+ "grad_norm": 0.4251123368740082,
+ "learning_rate": 8.704791146635483e-05,
+ "loss": 0.09420782327651978,
+ "mean_token_accuracy": 0.9677386932075024,
+ "num_tokens": 5790333.0,
+ "step": 2480
+ },
+ {
+ "epoch": 6.169364881693649,
+ "eval_entropy": 0.28572545962971313,
+ "eval_loss": 0.735416829586029,
+ "eval_mean_token_accuracy": 0.8487084663884584,
+ "eval_num_tokens": 5790333.0,
+ "eval_runtime": 85.4801,
+ "eval_samples_per_second": 16.086,
+ "eval_steps_per_second": 2.012,
+ "step": 2480
+ },
+ {
+ "entropy": 0.15587336672469973,
+ "epoch": 6.219178082191781,
+ "grad_norm": 0.4357028007507324,
+ "learning_rate": 8.514006786576085e-05,
+ "loss": 0.09429320096969604,
+ "mean_token_accuracy": 0.9682952925562859,
+ "num_tokens": 5837321.0,
+ "step": 2500
+ },
+ {
+ "epoch": 6.219178082191781,
+ "eval_entropy": 0.2859006894882335,
+ "eval_loss": 0.7347224950790405,
+ "eval_mean_token_accuracy": 0.8501905518215757,
+ "eval_num_tokens": 5837321.0,
+ "eval_runtime": 85.7578,
+ "eval_samples_per_second": 16.034,
+ "eval_steps_per_second": 2.006,
+ "step": 2500
+ },
+ {
+ "entropy": 0.15765639198943973,
+ "epoch": 6.268991282689913,
+ "grad_norm": 0.47331130504608154,
+ "learning_rate": 8.324066858090663e-05,
+ "loss": 0.09571113586425781,
+ "mean_token_accuracy": 0.9683481335639954,
+ "num_tokens": 5884398.0,
+ "step": 2520
+ },
+ {
+ "epoch": 6.268991282689913,
+ "eval_entropy": 0.29231513846059176,
+ "eval_loss": 0.7392512559890747,
+ "eval_mean_token_accuracy": 0.8486633983462356,
+ "eval_num_tokens": 5884398.0,
+ "eval_runtime": 85.7846,
+ "eval_samples_per_second": 16.029,
+ "eval_steps_per_second": 2.005,
+ "step": 2520
+ },
+ {
+ "entropy": 0.16176860257983208,
+ "epoch": 6.318804483188045,
+ "grad_norm": 0.6142018437385559,
+ "learning_rate": 8.135028644470992e-05,
+ "loss": 0.09486144185066223,
+ "mean_token_accuracy": 0.9682316601276397,
+ "num_tokens": 5929876.0,
+ "step": 2540
+ },
+ {
+ "epoch": 6.318804483188045,
+ "eval_entropy": 0.2851274753379267,
+ "eval_loss": 0.7520816922187805,
+ "eval_mean_token_accuracy": 0.8501113649717597,
+ "eval_num_tokens": 5929876.0,
+ "eval_runtime": 85.9425,
+ "eval_samples_per_second": 15.999,
+ "eval_steps_per_second": 2.001,
+ "step": 2540
+ },
+ {
+ "entropy": 0.15404034564271568,
+ "epoch": 6.3686176836861765,
+ "grad_norm": 0.6051287651062012,
+ "learning_rate": 7.946949157063964e-05,
+ "loss": 0.09280472993850708,
+ "mean_token_accuracy": 0.9684635892510414,
+ "num_tokens": 5978490.0,
+ "step": 2560
+ },
+ {
+ "epoch": 6.3686176836861765,
+ "eval_entropy": 0.28802703563557114,
+ "eval_loss": 0.7439162135124207,
+ "eval_mean_token_accuracy": 0.8499851770872293,
+ "eval_num_tokens": 5978490.0,
+ "eval_runtime": 86.0703,
+ "eval_samples_per_second": 15.975,
+ "eval_steps_per_second": 1.998,
+ "step": 2560
+ },
+ {
+ "entropy": 0.15343588953837753,
+ "epoch": 6.418430884184309,
+ "grad_norm": 0.4823743402957916,
+ "learning_rate": 7.759885118077701e-05,
+ "loss": 0.09000591039657593,
+ "mean_token_accuracy": 0.9699928767979145,
+ "num_tokens": 6025380.0,
+ "step": 2580
+ },
+ {
+ "epoch": 6.418430884184309,
+ "eval_entropy": 0.2795634938533916,
+ "eval_loss": 0.7647850513458252,
+ "eval_mean_token_accuracy": 0.8503464397995971,
+ "eval_num_tokens": 6025380.0,
+ "eval_runtime": 85.8886,
+ "eval_samples_per_second": 16.009,
+ "eval_steps_per_second": 2.003,
+ "step": 2580
+ },
+ {
+ "entropy": 0.15740026142448188,
+ "epoch": 6.468244084682441,
+ "grad_norm": 0.5082696676254272,
+ "learning_rate": 7.57389294347494e-05,
+ "loss": 0.09191849827766418,
+ "mean_token_accuracy": 0.9692809768021107,
+ "num_tokens": 6073349.0,
+ "step": 2600
+ },
+ {
+ "epoch": 6.468244084682441,
+ "eval_entropy": 0.2913342311458532,
+ "eval_loss": 0.7518694996833801,
+ "eval_mean_token_accuracy": 0.8483168302580367,
+ "eval_num_tokens": 6073349.0,
+ "eval_runtime": 85.5761,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.01,
+ "step": 2600
+ },
+ {
+ "entropy": 0.15922069251537324,
+ "epoch": 6.518057285180573,
+ "grad_norm": 0.3995199501514435,
+ "learning_rate": 7.389028725958736e-05,
+ "loss": 0.09584367871284485,
+ "mean_token_accuracy": 0.9685114495456218,
+ "num_tokens": 6118148.0,
+ "step": 2620
+ },
+ {
+ "epoch": 6.518057285180573,
+ "eval_entropy": 0.2863075934177221,
+ "eval_loss": 0.7539381384849548,
+ "eval_mean_token_accuracy": 0.8507507083027862,
+ "eval_num_tokens": 6118148.0,
+ "eval_runtime": 86.112,
+ "eval_samples_per_second": 15.968,
+ "eval_steps_per_second": 1.997,
+ "step": 2620
+ },
+ {
+ "entropy": 0.16197575423866512,
+ "epoch": 6.567870485678705,
+ "grad_norm": 0.534295380115509,
+ "learning_rate": 7.205348218055678e-05,
+ "loss": 0.0961170256137848,
+ "mean_token_accuracy": 0.9674530044198036,
+ "num_tokens": 6165523.0,
+ "step": 2640
+ },
+ {
+ "epoch": 6.567870485678705,
+ "eval_entropy": 0.29021967315050057,
+ "eval_loss": 0.751198947429657,
+ "eval_mean_token_accuracy": 0.8509796344956686,
+ "eval_num_tokens": 6165523.0,
+ "eval_runtime": 85.7958,
+ "eval_samples_per_second": 16.026,
+ "eval_steps_per_second": 2.005,
+ "step": 2640
+ },
+ {
+ "entropy": 0.15261746793985367,
+ "epoch": 6.617683686176837,
+ "grad_norm": 0.5391237139701843,
+ "learning_rate": 7.022906815301673e-05,
+ "loss": 0.0926026999950409,
+ "mean_token_accuracy": 0.9695659473538398,
+ "num_tokens": 6216232.0,
+ "step": 2660
+ },
+ {
+ "epoch": 6.617683686176837,
+ "eval_entropy": 0.29128045216202736,
+ "eval_loss": 0.7450292110443115,
+ "eval_mean_token_accuracy": 0.8498771443616512,
+ "eval_num_tokens": 6216232.0,
+ "eval_runtime": 86.3963,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 2660
+ },
+ {
+ "entropy": 0.16164180357009172,
+ "epoch": 6.667496886674969,
+ "grad_norm": 0.5767946243286133,
+ "learning_rate": 6.841759539535419e-05,
+ "loss": 0.09291981458663941,
+ "mean_token_accuracy": 0.9687136687338352,
+ "num_tokens": 6264807.0,
+ "step": 2680
+ },
+ {
+ "epoch": 6.667496886674969,
+ "eval_entropy": 0.2897637223088464,
+ "eval_loss": 0.7503410577774048,
+ "eval_mean_token_accuracy": 0.8503315164599308,
+ "eval_num_tokens": 6264807.0,
+ "eval_runtime": 86.0653,
+ "eval_samples_per_second": 15.976,
+ "eval_steps_per_second": 1.998,
+ "step": 2680
+ },
+ {
+ "entropy": 0.17062523355707526,
+ "epoch": 6.717310087173101,
+ "grad_norm": 0.4974168539047241,
+ "learning_rate": 6.661961022304563e-05,
+ "loss": 0.09713236689567566,
+ "mean_token_accuracy": 0.9661971725523472,
+ "num_tokens": 6308819.0,
+ "step": 2700
+ },
+ {
+ "epoch": 6.717310087173101,
+ "eval_entropy": 0.2765843396963075,
+ "eval_loss": 0.7604002356529236,
+ "eval_mean_token_accuracy": 0.8521115277395692,
+ "eval_num_tokens": 6308819.0,
+ "eval_runtime": 86.1676,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 2700
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.66178337196501e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2720/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2720/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2720/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2720/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2720/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2720/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2720/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2720/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2720/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2720/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2720/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2720/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2720/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2720/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..c3aee5a8ba5955f58278dcab3ef8fddda4dc3d42
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2720/trainer_state.json
@@ -0,0 +1,2890 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 6.767123287671232,
+ "eval_steps": 20,
+ "global_step": 2720,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ },
+ {
+ "entropy": 0.3193941755220294,
+ "epoch": 4.5280199252802,
+ "grad_norm": 0.8281906843185425,
+ "learning_rate": 0.0001509111761786888,
+ "loss": 0.23936262130737304,
+ "mean_token_accuracy": 0.9201708927750587,
+ "num_tokens": 4244423.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.5280199252802,
+ "eval_entropy": 0.38704028864239537,
+ "eval_loss": 0.6006569266319275,
+ "eval_mean_token_accuracy": 0.8502406720505205,
+ "eval_num_tokens": 4244423.0,
+ "eval_runtime": 86.8059,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1820
+ },
+ {
+ "entropy": 0.3164879363030195,
+ "epoch": 4.577833125778331,
+ "grad_norm": 0.7892968654632568,
+ "learning_rate": 0.00014905346557909867,
+ "loss": 0.24541733264923096,
+ "mean_token_accuracy": 0.9175932116806507,
+ "num_tokens": 4289773.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.577833125778331,
+ "eval_entropy": 0.38861122120951497,
+ "eval_loss": 0.6115967631340027,
+ "eval_mean_token_accuracy": 0.849471275196519,
+ "eval_num_tokens": 4289773.0,
+ "eval_runtime": 86.2946,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1840
+ },
+ {
+ "entropy": 0.3051785985007882,
+ "epoch": 4.627646326276463,
+ "grad_norm": 0.8109654188156128,
+ "learning_rate": 0.0001471849238862319,
+ "loss": 0.23433220386505127,
+ "mean_token_accuracy": 0.9206570319831371,
+ "num_tokens": 4336894.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.627646326276463,
+ "eval_entropy": 0.37162452295076015,
+ "eval_loss": 0.6184061765670776,
+ "eval_mean_token_accuracy": 0.8501173268223918,
+ "eval_num_tokens": 4336894.0,
+ "eval_runtime": 86.6865,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1860
+ },
+ {
+ "entropy": 0.3168198253959417,
+ "epoch": 4.677459526774595,
+ "grad_norm": 0.9512342214584351,
+ "learning_rate": 0.0001453061146267775,
+ "loss": 0.23832404613494873,
+ "mean_token_accuracy": 0.9197044663131237,
+ "num_tokens": 4382947.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.677459526774595,
+ "eval_entropy": 0.3845940856912801,
+ "eval_loss": 0.606762707233429,
+ "eval_mean_token_accuracy": 0.8504838194957999,
+ "eval_num_tokens": 4382947.0,
+ "eval_runtime": 86.5175,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 1880
+ },
+ {
+ "entropy": 0.30791807882487776,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 0.8123113512992859,
+ "learning_rate": 0.00014341760442398248,
+ "loss": 0.2395785331726074,
+ "mean_token_accuracy": 0.918928150832653,
+ "num_tokens": 4433050.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.7272727272727275,
+ "eval_entropy": 0.39762327222283494,
+ "eval_loss": 0.5994202494621277,
+ "eval_mean_token_accuracy": 0.8509274201337681,
+ "eval_num_tokens": 4433050.0,
+ "eval_runtime": 86.2873,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.993,
+ "step": 1900
+ },
+ {
+ "entropy": 0.3021434534341097,
+ "epoch": 4.777085927770859,
+ "grad_norm": 0.731787383556366,
+ "learning_rate": 0.000141519962826766,
+ "loss": 0.23494718074798585,
+ "mean_token_accuracy": 0.9201403826475143,
+ "num_tokens": 4483598.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.777085927770859,
+ "eval_entropy": 0.3827026732439219,
+ "eval_loss": 0.5995895862579346,
+ "eval_mean_token_accuracy": 0.851468373523202,
+ "eval_num_tokens": 4483598.0,
+ "eval_runtime": 86.3006,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 1920
+ },
+ {
+ "entropy": 0.31626159623265265,
+ "epoch": 4.826899128268991,
+ "grad_norm": 0.8848487138748169,
+ "learning_rate": 0.00013961376213795132,
+ "loss": 0.2439030647277832,
+ "mean_token_accuracy": 0.9196575872600079,
+ "num_tokens": 4529201.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.826899128268991,
+ "eval_entropy": 0.388698436839636,
+ "eval_loss": 0.6000174283981323,
+ "eval_mean_token_accuracy": 0.8518068187458571,
+ "eval_num_tokens": 4529201.0,
+ "eval_runtime": 86.8979,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.979,
+ "step": 1940
+ },
+ {
+ "entropy": 0.30520407035946845,
+ "epoch": 4.876712328767123,
+ "grad_norm": 0.8532460927963257,
+ "learning_rate": 0.00013769957724166695,
+ "loss": 0.23458616733551024,
+ "mean_token_accuracy": 0.9221912942826748,
+ "num_tokens": 4578167.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.876712328767123,
+ "eval_entropy": 0.38777847102908203,
+ "eval_loss": 0.6004981398582458,
+ "eval_mean_token_accuracy": 0.8516481768253238,
+ "eval_num_tokens": 4578167.0,
+ "eval_runtime": 87.0777,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.975,
+ "step": 1960
+ },
+ {
+ "entropy": 0.3226448342204094,
+ "epoch": 4.926525529265255,
+ "grad_norm": 0.6945561766624451,
+ "learning_rate": 0.0001357779854299694,
+ "loss": 0.24048397541046143,
+ "mean_token_accuracy": 0.9195300146937371,
+ "num_tokens": 4622316.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.926525529265255,
+ "eval_entropy": 0.38581624263247777,
+ "eval_loss": 0.6029234528541565,
+ "eval_mean_token_accuracy": 0.8514213260523108,
+ "eval_num_tokens": 4622316.0,
+ "eval_runtime": 85.8729,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 1980
+ },
+ {
+ "entropy": 0.3051655298098922,
+ "epoch": 4.976338729763388,
+ "grad_norm": 0.7976452708244324,
+ "learning_rate": 0.00013384956622874001,
+ "loss": 0.23584742546081544,
+ "mean_token_accuracy": 0.9216851457953453,
+ "num_tokens": 4670746.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.976338729763388,
+ "eval_entropy": 0.37913159246361533,
+ "eval_loss": 0.6057604551315308,
+ "eval_mean_token_accuracy": 0.8525801203971686,
+ "eval_num_tokens": 4670746.0,
+ "eval_runtime": 86.1145,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2000
+ },
+ {
+ "entropy": 0.27438195240803254,
+ "epoch": 5.024906600249066,
+ "grad_norm": 0.6729586124420166,
+ "learning_rate": 0.0001319149012229075,
+ "loss": 0.19775952100753785,
+ "mean_token_accuracy": 0.9339428559327737,
+ "num_tokens": 4716176.0,
+ "step": 2020
+ },
+ {
+ "epoch": 5.024906600249066,
+ "eval_entropy": 0.3448961910813354,
+ "eval_loss": 0.6750120520591736,
+ "eval_mean_token_accuracy": 0.8487970232963562,
+ "eval_num_tokens": 4716176.0,
+ "eval_runtime": 86.1169,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2020
+ },
+ {
+ "entropy": 0.21423916313797237,
+ "epoch": 5.074719800747198,
+ "grad_norm": 0.6934391856193542,
+ "learning_rate": 0.00012997457388105022,
+ "loss": 0.1439570426940918,
+ "mean_token_accuracy": 0.9528236843645572,
+ "num_tokens": 4763269.0,
+ "step": 2040
+ },
+ {
+ "epoch": 5.074719800747198,
+ "eval_entropy": 0.3570949243771475,
+ "eval_loss": 0.6465504169464111,
+ "eval_mean_token_accuracy": 0.8490785547467166,
+ "eval_num_tokens": 4763269.0,
+ "eval_runtime": 85.9574,
+ "eval_samples_per_second": 15.996,
+ "eval_steps_per_second": 2.001,
+ "step": 2040
+ },
+ {
+ "entropy": 0.20838565267622472,
+ "epoch": 5.12453300124533,
+ "grad_norm": 0.7286986112594604,
+ "learning_rate": 0.00012802916937942972,
+ "loss": 0.14467307329177856,
+ "mean_token_accuracy": 0.950994835793972,
+ "num_tokens": 4809047.0,
+ "step": 2060
+ },
+ {
+ "epoch": 5.12453300124533,
+ "eval_entropy": 0.3452463157821533,
+ "eval_loss": 0.6705958843231201,
+ "eval_mean_token_accuracy": 0.8490352796953778,
+ "eval_num_tokens": 4809047.0,
+ "eval_runtime": 86.228,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 2060
+ },
+ {
+ "entropy": 0.20453082229942082,
+ "epoch": 5.174346201743462,
+ "grad_norm": 0.7515555620193481,
+ "learning_rate": 0.00012607927442550974,
+ "loss": 0.13732000589370727,
+ "mean_token_accuracy": 0.9537357829511166,
+ "num_tokens": 4857965.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.174346201743462,
+ "eval_entropy": 0.32431264914745506,
+ "eval_loss": 0.6743043065071106,
+ "eval_mean_token_accuracy": 0.8504878629085629,
+ "eval_num_tokens": 4857965.0,
+ "eval_runtime": 86.5948,
+ "eval_samples_per_second": 15.879,
+ "eval_steps_per_second": 1.986,
+ "step": 2080
+ },
+ {
+ "entropy": 0.21812320686876774,
+ "epoch": 5.224159402241594,
+ "grad_norm": 0.9093465209007263,
+ "learning_rate": 0.0001241254770810132,
+ "loss": 0.14311420917510986,
+ "mean_token_accuracy": 0.9514068141579628,
+ "num_tokens": 4905151.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.224159402241594,
+ "eval_entropy": 0.33086285835435225,
+ "eval_loss": 0.6676449179649353,
+ "eval_mean_token_accuracy": 0.8505287662495015,
+ "eval_num_tokens": 4905151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 2100
+ },
+ {
+ "entropy": 0.2180163251236081,
+ "epoch": 5.273972602739726,
+ "grad_norm": 0.6703007221221924,
+ "learning_rate": 0.00012216836658457075,
+ "loss": 0.14803968667984008,
+ "mean_token_accuracy": 0.9521303348243236,
+ "num_tokens": 4947072.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.273972602739726,
+ "eval_entropy": 0.33162341708707255,
+ "eval_loss": 0.6658875942230225,
+ "eval_mean_token_accuracy": 0.8500757605530495,
+ "eval_num_tokens": 4947072.0,
+ "eval_runtime": 86.6296,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 2120
+ },
+ {
+ "entropy": 0.22511130161583423,
+ "epoch": 5.323785803237858,
+ "grad_norm": 0.8078880906105042,
+ "learning_rate": 0.00012020853317401455,
+ "loss": 0.15228408575057983,
+ "mean_token_accuracy": 0.947144789993763,
+ "num_tokens": 4991974.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.323785803237858,
+ "eval_entropy": 0.3354601170434508,
+ "eval_loss": 0.6677829623222351,
+ "eval_mean_token_accuracy": 0.8482600024273229,
+ "eval_num_tokens": 4991974.0,
+ "eval_runtime": 86.4689,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.989,
+ "step": 2140
+ },
+ {
+ "entropy": 0.2244176059961319,
+ "epoch": 5.37359900373599,
+ "grad_norm": 0.9636075496673584,
+ "learning_rate": 0.00011824656790837037,
+ "loss": 0.15260883569717407,
+ "mean_token_accuracy": 0.9471467643976211,
+ "num_tokens": 5038400.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.37359900373599,
+ "eval_entropy": 0.3381616926297199,
+ "eval_loss": 0.6694412231445312,
+ "eval_mean_token_accuracy": 0.8482369603805764,
+ "eval_num_tokens": 5038400.0,
+ "eval_runtime": 86.4147,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 2160
+ },
+ {
+ "entropy": 0.22982364390045404,
+ "epoch": 5.423412204234122,
+ "grad_norm": 0.775401771068573,
+ "learning_rate": 0.00011628306248960262,
+ "loss": 0.15140302181243898,
+ "mean_token_accuracy": 0.9492553934454918,
+ "num_tokens": 5083166.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.423412204234122,
+ "eval_entropy": 0.3305150235808173,
+ "eval_loss": 0.6717822551727295,
+ "eval_mean_token_accuracy": 0.8489849723355715,
+ "eval_num_tokens": 5083166.0,
+ "eval_runtime": 86.4728,
+ "eval_samples_per_second": 15.901,
+ "eval_steps_per_second": 1.989,
+ "step": 2180
+ },
+ {
+ "entropy": 0.21448935717344284,
+ "epoch": 5.473225404732254,
+ "grad_norm": 0.6575281023979187,
+ "learning_rate": 0.00011431860908416465,
+ "loss": 0.1452319622039795,
+ "mean_token_accuracy": 0.9505287684500218,
+ "num_tokens": 5135109.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.473225404732254,
+ "eval_entropy": 0.3488145174328671,
+ "eval_loss": 0.6612305641174316,
+ "eval_mean_token_accuracy": 0.8492907808963642,
+ "eval_num_tokens": 5135109.0,
+ "eval_runtime": 86.6927,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 2200
+ },
+ {
+ "entropy": 0.23091202937066554,
+ "epoch": 5.523038605230386,
+ "grad_norm": 0.8909686207771301,
+ "learning_rate": 0.00011235380014440985,
+ "loss": 0.15150139331817628,
+ "mean_token_accuracy": 0.9497875183820724,
+ "num_tokens": 5180138.0,
+ "step": 2220
+ },
+ {
+ "epoch": 5.523038605230386,
+ "eval_entropy": 0.3268539015810157,
+ "eval_loss": 0.6667542457580566,
+ "eval_mean_token_accuracy": 0.8499062903398691,
+ "eval_num_tokens": 5180138.0,
+ "eval_runtime": 86.4644,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 2220
+ },
+ {
+ "entropy": 0.2227974807843566,
+ "epoch": 5.572851805728518,
+ "grad_norm": 0.6180275082588196,
+ "learning_rate": 0.0001103892282299158,
+ "loss": 0.1491069197654724,
+ "mean_token_accuracy": 0.9488144010305405,
+ "num_tokens": 5226864.0,
+ "step": 2240
+ },
+ {
+ "epoch": 5.572851805728518,
+ "eval_entropy": 0.3346347655494546,
+ "eval_loss": 0.6665948629379272,
+ "eval_mean_token_accuracy": 0.8499961893918903,
+ "eval_num_tokens": 5226864.0,
+ "eval_runtime": 87.0548,
+ "eval_samples_per_second": 15.795,
+ "eval_steps_per_second": 1.976,
+ "step": 2240
+ },
+ {
+ "entropy": 0.21368421968072654,
+ "epoch": 5.62266500622665,
+ "grad_norm": 0.6004369258880615,
+ "learning_rate": 0.00010842548582877651,
+ "loss": 0.14485255479812623,
+ "mean_token_accuracy": 0.9502056457102299,
+ "num_tokens": 5276602.0,
+ "step": 2260
+ },
+ {
+ "epoch": 5.62266500622665,
+ "eval_entropy": 0.32753298804163933,
+ "eval_loss": 0.6680151224136353,
+ "eval_mean_token_accuracy": 0.8515451086121936,
+ "eval_num_tokens": 5276602.0,
+ "eval_runtime": 86.8524,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.98,
+ "step": 2260
+ },
+ {
+ "entropy": 0.2103635374456644,
+ "epoch": 5.672478206724782,
+ "grad_norm": 0.699174702167511,
+ "learning_rate": 0.00010646316517891613,
+ "loss": 0.14297772645950318,
+ "mean_token_accuracy": 0.9512537539005279,
+ "num_tokens": 5323718.0,
+ "step": 2280
+ },
+ {
+ "epoch": 5.672478206724782,
+ "eval_entropy": 0.32966585959806,
+ "eval_loss": 0.675578773021698,
+ "eval_mean_token_accuracy": 0.8509623023659684,
+ "eval_num_tokens": 5323718.0,
+ "eval_runtime": 86.4518,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2280
+ },
+ {
+ "entropy": 0.22516900151968003,
+ "epoch": 5.722291407222914,
+ "grad_norm": 0.6637354493141174,
+ "learning_rate": 0.00010450285808947797,
+ "loss": 0.15202572345733642,
+ "mean_token_accuracy": 0.9482452072203159,
+ "num_tokens": 5369039.0,
+ "step": 2300
+ },
+ {
+ "epoch": 5.722291407222914,
+ "eval_entropy": 0.3369456917740578,
+ "eval_loss": 0.6697061061859131,
+ "eval_mean_token_accuracy": 0.848603522361711,
+ "eval_num_tokens": 5369039.0,
+ "eval_runtime": 86.6371,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.985,
+ "step": 2300
+ },
+ {
+ "entropy": 0.21841065725311637,
+ "epoch": 5.772104607721046,
+ "grad_norm": 0.7940268516540527,
+ "learning_rate": 0.00010254515576234297,
+ "loss": 0.14710167646408082,
+ "mean_token_accuracy": 0.9493498183786869,
+ "num_tokens": 5417029.0,
+ "step": 2320
+ },
+ {
+ "epoch": 5.772104607721046,
+ "eval_entropy": 0.3237486180177955,
+ "eval_loss": 0.6779657602310181,
+ "eval_mean_token_accuracy": 0.8500715313955794,
+ "eval_num_tokens": 5417029.0,
+ "eval_runtime": 86.1826,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 1.996,
+ "step": 2320
+ },
+ {
+ "entropy": 0.22146204356104135,
+ "epoch": 5.821917808219178,
+ "grad_norm": 0.9234833121299744,
+ "learning_rate": 0.00010059064861383132,
+ "loss": 0.14720046520233154,
+ "mean_token_accuracy": 0.9493872679769992,
+ "num_tokens": 5461671.0,
+ "step": 2340
+ },
+ {
+ "epoch": 5.821917808219178,
+ "eval_entropy": 0.32365207564692167,
+ "eval_loss": 0.6704005002975464,
+ "eval_mean_token_accuracy": 0.8507985760306203,
+ "eval_num_tokens": 5461671.0,
+ "eval_runtime": 86.5494,
+ "eval_samples_per_second": 15.887,
+ "eval_steps_per_second": 1.987,
+ "step": 2340
+ },
+ {
+ "entropy": 0.20934011954814197,
+ "epoch": 5.87173100871731,
+ "grad_norm": 0.5547503232955933,
+ "learning_rate": 9.863992609664084e-05,
+ "loss": 0.1464867353439331,
+ "mean_token_accuracy": 0.9503875687718392,
+ "num_tokens": 5509312.0,
+ "step": 2360
+ },
+ {
+ "epoch": 5.87173100871731,
+ "eval_entropy": 0.3330401429083458,
+ "eval_loss": 0.6659091114997864,
+ "eval_mean_token_accuracy": 0.8504848906467127,
+ "eval_num_tokens": 5509312.0,
+ "eval_runtime": 86.5855,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 2360
+ },
+ {
+ "entropy": 0.21678635366261007,
+ "epoch": 5.921544209215442,
+ "grad_norm": 0.570612907409668,
+ "learning_rate": 9.669357652207635e-05,
+ "loss": 0.14821385145187377,
+ "mean_token_accuracy": 0.9503940217196941,
+ "num_tokens": 5558196.0,
+ "step": 2380
+ },
+ {
+ "epoch": 5.921544209215442,
+ "eval_entropy": 0.3322022325077722,
+ "eval_loss": 0.6722489595413208,
+ "eval_mean_token_accuracy": 0.8489979422369669,
+ "eval_num_tokens": 5558196.0,
+ "eval_runtime": 86.2986,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 2380
+ },
+ {
+ "entropy": 0.20932920072227718,
+ "epoch": 5.971357409713574,
+ "grad_norm": 0.7879557609558105,
+ "learning_rate": 9.475218688262262e-05,
+ "loss": 0.14675841331481934,
+ "mean_token_accuracy": 0.9507176131010056,
+ "num_tokens": 5605400.0,
+ "step": 2400
+ },
+ {
+ "epoch": 5.971357409713574,
+ "eval_entropy": 0.3199348642902319,
+ "eval_loss": 0.6698136329650879,
+ "eval_mean_token_accuracy": 0.8514142130003419,
+ "eval_num_tokens": 5605400.0,
+ "eval_runtime": 85.8995,
+ "eval_samples_per_second": 16.007,
+ "eval_steps_per_second": 2.002,
+ "step": 2400
+ },
+ {
+ "entropy": 0.21032143919131693,
+ "epoch": 6.019925280199253,
+ "grad_norm": 0.5823076367378235,
+ "learning_rate": 9.281634267491569e-05,
+ "loss": 0.13322267532348633,
+ "mean_token_accuracy": 0.9550939072401096,
+ "num_tokens": 5648968.0,
+ "step": 2420
+ },
+ {
+ "epoch": 6.019925280199253,
+ "eval_entropy": 0.30206270117399303,
+ "eval_loss": 0.7093168497085571,
+ "eval_mean_token_accuracy": 0.8500627639681794,
+ "eval_num_tokens": 5648968.0,
+ "eval_runtime": 85.8128,
+ "eval_samples_per_second": 16.023,
+ "eval_steps_per_second": 2.004,
+ "step": 2420
+ },
+ {
+ "entropy": 0.1534628233872354,
+ "epoch": 6.069738480697385,
+ "grad_norm": 0.710133969783783,
+ "learning_rate": 9.088662772316508e-05,
+ "loss": 0.09078952670097351,
+ "mean_token_accuracy": 0.9678447999060154,
+ "num_tokens": 5697633.0,
+ "step": 2440
+ },
+ {
+ "epoch": 6.069738480697385,
+ "eval_entropy": 0.28208133101809857,
+ "eval_loss": 0.7636417150497437,
+ "eval_mean_token_accuracy": 0.8494061477655588,
+ "eval_num_tokens": 5697633.0,
+ "eval_runtime": 85.9724,
+ "eval_samples_per_second": 15.994,
+ "eval_steps_per_second": 2.001,
+ "step": 2440
+ },
+ {
+ "entropy": 0.16151462448760867,
+ "epoch": 6.119551681195516,
+ "grad_norm": 0.5793812274932861,
+ "learning_rate": 8.896362400308028e-05,
+ "loss": 0.09545697569847107,
+ "mean_token_accuracy": 0.9671573750674725,
+ "num_tokens": 5745090.0,
+ "step": 2460
+ },
+ {
+ "epoch": 6.119551681195516,
+ "eval_entropy": 0.2833245605403601,
+ "eval_loss": 0.7402405738830566,
+ "eval_mean_token_accuracy": 0.8503523728875226,
+ "eval_num_tokens": 5745090.0,
+ "eval_runtime": 85.5461,
+ "eval_samples_per_second": 16.073,
+ "eval_steps_per_second": 2.011,
+ "step": 2460
+ },
+ {
+ "entropy": 0.15203177919611335,
+ "epoch": 6.169364881693649,
+ "grad_norm": 0.4251123368740082,
+ "learning_rate": 8.704791146635483e-05,
+ "loss": 0.09420782327651978,
+ "mean_token_accuracy": 0.9677386932075024,
+ "num_tokens": 5790333.0,
+ "step": 2480
+ },
+ {
+ "epoch": 6.169364881693649,
+ "eval_entropy": 0.28572545962971313,
+ "eval_loss": 0.735416829586029,
+ "eval_mean_token_accuracy": 0.8487084663884584,
+ "eval_num_tokens": 5790333.0,
+ "eval_runtime": 85.4801,
+ "eval_samples_per_second": 16.086,
+ "eval_steps_per_second": 2.012,
+ "step": 2480
+ },
+ {
+ "entropy": 0.15587336672469973,
+ "epoch": 6.219178082191781,
+ "grad_norm": 0.4357028007507324,
+ "learning_rate": 8.514006786576085e-05,
+ "loss": 0.09429320096969604,
+ "mean_token_accuracy": 0.9682952925562859,
+ "num_tokens": 5837321.0,
+ "step": 2500
+ },
+ {
+ "epoch": 6.219178082191781,
+ "eval_entropy": 0.2859006894882335,
+ "eval_loss": 0.7347224950790405,
+ "eval_mean_token_accuracy": 0.8501905518215757,
+ "eval_num_tokens": 5837321.0,
+ "eval_runtime": 85.7578,
+ "eval_samples_per_second": 16.034,
+ "eval_steps_per_second": 2.006,
+ "step": 2500
+ },
+ {
+ "entropy": 0.15765639198943973,
+ "epoch": 6.268991282689913,
+ "grad_norm": 0.47331130504608154,
+ "learning_rate": 8.324066858090663e-05,
+ "loss": 0.09571113586425781,
+ "mean_token_accuracy": 0.9683481335639954,
+ "num_tokens": 5884398.0,
+ "step": 2520
+ },
+ {
+ "epoch": 6.268991282689913,
+ "eval_entropy": 0.29231513846059176,
+ "eval_loss": 0.7392512559890747,
+ "eval_mean_token_accuracy": 0.8486633983462356,
+ "eval_num_tokens": 5884398.0,
+ "eval_runtime": 85.7846,
+ "eval_samples_per_second": 16.029,
+ "eval_steps_per_second": 2.005,
+ "step": 2520
+ },
+ {
+ "entropy": 0.16176860257983208,
+ "epoch": 6.318804483188045,
+ "grad_norm": 0.6142018437385559,
+ "learning_rate": 8.135028644470992e-05,
+ "loss": 0.09486144185066223,
+ "mean_token_accuracy": 0.9682316601276397,
+ "num_tokens": 5929876.0,
+ "step": 2540
+ },
+ {
+ "epoch": 6.318804483188045,
+ "eval_entropy": 0.2851274753379267,
+ "eval_loss": 0.7520816922187805,
+ "eval_mean_token_accuracy": 0.8501113649717597,
+ "eval_num_tokens": 5929876.0,
+ "eval_runtime": 85.9425,
+ "eval_samples_per_second": 15.999,
+ "eval_steps_per_second": 2.001,
+ "step": 2540
+ },
+ {
+ "entropy": 0.15404034564271568,
+ "epoch": 6.3686176836861765,
+ "grad_norm": 0.6051287651062012,
+ "learning_rate": 7.946949157063964e-05,
+ "loss": 0.09280472993850708,
+ "mean_token_accuracy": 0.9684635892510414,
+ "num_tokens": 5978490.0,
+ "step": 2560
+ },
+ {
+ "epoch": 6.3686176836861765,
+ "eval_entropy": 0.28802703563557114,
+ "eval_loss": 0.7439162135124207,
+ "eval_mean_token_accuracy": 0.8499851770872293,
+ "eval_num_tokens": 5978490.0,
+ "eval_runtime": 86.0703,
+ "eval_samples_per_second": 15.975,
+ "eval_steps_per_second": 1.998,
+ "step": 2560
+ },
+ {
+ "entropy": 0.15343588953837753,
+ "epoch": 6.418430884184309,
+ "grad_norm": 0.4823743402957916,
+ "learning_rate": 7.759885118077701e-05,
+ "loss": 0.09000591039657593,
+ "mean_token_accuracy": 0.9699928767979145,
+ "num_tokens": 6025380.0,
+ "step": 2580
+ },
+ {
+ "epoch": 6.418430884184309,
+ "eval_entropy": 0.2795634938533916,
+ "eval_loss": 0.7647850513458252,
+ "eval_mean_token_accuracy": 0.8503464397995971,
+ "eval_num_tokens": 6025380.0,
+ "eval_runtime": 85.8886,
+ "eval_samples_per_second": 16.009,
+ "eval_steps_per_second": 2.003,
+ "step": 2580
+ },
+ {
+ "entropy": 0.15740026142448188,
+ "epoch": 6.468244084682441,
+ "grad_norm": 0.5082696676254272,
+ "learning_rate": 7.57389294347494e-05,
+ "loss": 0.09191849827766418,
+ "mean_token_accuracy": 0.9692809768021107,
+ "num_tokens": 6073349.0,
+ "step": 2600
+ },
+ {
+ "epoch": 6.468244084682441,
+ "eval_entropy": 0.2913342311458532,
+ "eval_loss": 0.7518694996833801,
+ "eval_mean_token_accuracy": 0.8483168302580367,
+ "eval_num_tokens": 6073349.0,
+ "eval_runtime": 85.5761,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.01,
+ "step": 2600
+ },
+ {
+ "entropy": 0.15922069251537324,
+ "epoch": 6.518057285180573,
+ "grad_norm": 0.3995199501514435,
+ "learning_rate": 7.389028725958736e-05,
+ "loss": 0.09584367871284485,
+ "mean_token_accuracy": 0.9685114495456218,
+ "num_tokens": 6118148.0,
+ "step": 2620
+ },
+ {
+ "epoch": 6.518057285180573,
+ "eval_entropy": 0.2863075934177221,
+ "eval_loss": 0.7539381384849548,
+ "eval_mean_token_accuracy": 0.8507507083027862,
+ "eval_num_tokens": 6118148.0,
+ "eval_runtime": 86.112,
+ "eval_samples_per_second": 15.968,
+ "eval_steps_per_second": 1.997,
+ "step": 2620
+ },
+ {
+ "entropy": 0.16197575423866512,
+ "epoch": 6.567870485678705,
+ "grad_norm": 0.534295380115509,
+ "learning_rate": 7.205348218055678e-05,
+ "loss": 0.0961170256137848,
+ "mean_token_accuracy": 0.9674530044198036,
+ "num_tokens": 6165523.0,
+ "step": 2640
+ },
+ {
+ "epoch": 6.567870485678705,
+ "eval_entropy": 0.29021967315050057,
+ "eval_loss": 0.751198947429657,
+ "eval_mean_token_accuracy": 0.8509796344956686,
+ "eval_num_tokens": 6165523.0,
+ "eval_runtime": 85.7958,
+ "eval_samples_per_second": 16.026,
+ "eval_steps_per_second": 2.005,
+ "step": 2640
+ },
+ {
+ "entropy": 0.15261746793985367,
+ "epoch": 6.617683686176837,
+ "grad_norm": 0.5391237139701843,
+ "learning_rate": 7.022906815301673e-05,
+ "loss": 0.0926026999950409,
+ "mean_token_accuracy": 0.9695659473538398,
+ "num_tokens": 6216232.0,
+ "step": 2660
+ },
+ {
+ "epoch": 6.617683686176837,
+ "eval_entropy": 0.29128045216202736,
+ "eval_loss": 0.7450292110443115,
+ "eval_mean_token_accuracy": 0.8498771443616512,
+ "eval_num_tokens": 6216232.0,
+ "eval_runtime": 86.3963,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 2660
+ },
+ {
+ "entropy": 0.16164180357009172,
+ "epoch": 6.667496886674969,
+ "grad_norm": 0.5767946243286133,
+ "learning_rate": 6.841759539535419e-05,
+ "loss": 0.09291981458663941,
+ "mean_token_accuracy": 0.9687136687338352,
+ "num_tokens": 6264807.0,
+ "step": 2680
+ },
+ {
+ "epoch": 6.667496886674969,
+ "eval_entropy": 0.2897637223088464,
+ "eval_loss": 0.7503410577774048,
+ "eval_mean_token_accuracy": 0.8503315164599308,
+ "eval_num_tokens": 6264807.0,
+ "eval_runtime": 86.0653,
+ "eval_samples_per_second": 15.976,
+ "eval_steps_per_second": 1.998,
+ "step": 2680
+ },
+ {
+ "entropy": 0.17062523355707526,
+ "epoch": 6.717310087173101,
+ "grad_norm": 0.4974168539047241,
+ "learning_rate": 6.661961022304563e-05,
+ "loss": 0.09713236689567566,
+ "mean_token_accuracy": 0.9661971725523472,
+ "num_tokens": 6308819.0,
+ "step": 2700
+ },
+ {
+ "epoch": 6.717310087173101,
+ "eval_entropy": 0.2765843396963075,
+ "eval_loss": 0.7604002356529236,
+ "eval_mean_token_accuracy": 0.8521115277395692,
+ "eval_num_tokens": 6308819.0,
+ "eval_runtime": 86.1676,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 2700
+ },
+ {
+ "entropy": 0.17544092936441302,
+ "epoch": 6.767123287671232,
+ "grad_norm": 0.5523537993431091,
+ "learning_rate": 6.483565488389582e-05,
+ "loss": 0.09709116220474243,
+ "mean_token_accuracy": 0.9650957375764847,
+ "num_tokens": 6352548.0,
+ "step": 2720
+ },
+ {
+ "epoch": 6.767123287671232,
+ "eval_entropy": 0.27939334659035814,
+ "eval_loss": 0.7534670829772949,
+ "eval_mean_token_accuracy": 0.851230604010959,
+ "eval_num_tokens": 6352548.0,
+ "eval_runtime": 86.2913,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 2720
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.679866939150684e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2740/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2740/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2740/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2740/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2740/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2740/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2740/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2740/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2740/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2740/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2740/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2740/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2740/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2740/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..0c863a78cff23af5c6feeaefa6eabff8fb60555b
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2740/trainer_state.json
@@ -0,0 +1,2911 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 6.816936488169365,
+ "eval_steps": 20,
+ "global_step": 2740,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ },
+ {
+ "entropy": 0.3193941755220294,
+ "epoch": 4.5280199252802,
+ "grad_norm": 0.8281906843185425,
+ "learning_rate": 0.0001509111761786888,
+ "loss": 0.23936262130737304,
+ "mean_token_accuracy": 0.9201708927750587,
+ "num_tokens": 4244423.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.5280199252802,
+ "eval_entropy": 0.38704028864239537,
+ "eval_loss": 0.6006569266319275,
+ "eval_mean_token_accuracy": 0.8502406720505205,
+ "eval_num_tokens": 4244423.0,
+ "eval_runtime": 86.8059,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1820
+ },
+ {
+ "entropy": 0.3164879363030195,
+ "epoch": 4.577833125778331,
+ "grad_norm": 0.7892968654632568,
+ "learning_rate": 0.00014905346557909867,
+ "loss": 0.24541733264923096,
+ "mean_token_accuracy": 0.9175932116806507,
+ "num_tokens": 4289773.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.577833125778331,
+ "eval_entropy": 0.38861122120951497,
+ "eval_loss": 0.6115967631340027,
+ "eval_mean_token_accuracy": 0.849471275196519,
+ "eval_num_tokens": 4289773.0,
+ "eval_runtime": 86.2946,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1840
+ },
+ {
+ "entropy": 0.3051785985007882,
+ "epoch": 4.627646326276463,
+ "grad_norm": 0.8109654188156128,
+ "learning_rate": 0.0001471849238862319,
+ "loss": 0.23433220386505127,
+ "mean_token_accuracy": 0.9206570319831371,
+ "num_tokens": 4336894.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.627646326276463,
+ "eval_entropy": 0.37162452295076015,
+ "eval_loss": 0.6184061765670776,
+ "eval_mean_token_accuracy": 0.8501173268223918,
+ "eval_num_tokens": 4336894.0,
+ "eval_runtime": 86.6865,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1860
+ },
+ {
+ "entropy": 0.3168198253959417,
+ "epoch": 4.677459526774595,
+ "grad_norm": 0.9512342214584351,
+ "learning_rate": 0.0001453061146267775,
+ "loss": 0.23832404613494873,
+ "mean_token_accuracy": 0.9197044663131237,
+ "num_tokens": 4382947.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.677459526774595,
+ "eval_entropy": 0.3845940856912801,
+ "eval_loss": 0.606762707233429,
+ "eval_mean_token_accuracy": 0.8504838194957999,
+ "eval_num_tokens": 4382947.0,
+ "eval_runtime": 86.5175,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 1880
+ },
+ {
+ "entropy": 0.30791807882487776,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 0.8123113512992859,
+ "learning_rate": 0.00014341760442398248,
+ "loss": 0.2395785331726074,
+ "mean_token_accuracy": 0.918928150832653,
+ "num_tokens": 4433050.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.7272727272727275,
+ "eval_entropy": 0.39762327222283494,
+ "eval_loss": 0.5994202494621277,
+ "eval_mean_token_accuracy": 0.8509274201337681,
+ "eval_num_tokens": 4433050.0,
+ "eval_runtime": 86.2873,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.993,
+ "step": 1900
+ },
+ {
+ "entropy": 0.3021434534341097,
+ "epoch": 4.777085927770859,
+ "grad_norm": 0.731787383556366,
+ "learning_rate": 0.000141519962826766,
+ "loss": 0.23494718074798585,
+ "mean_token_accuracy": 0.9201403826475143,
+ "num_tokens": 4483598.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.777085927770859,
+ "eval_entropy": 0.3827026732439219,
+ "eval_loss": 0.5995895862579346,
+ "eval_mean_token_accuracy": 0.851468373523202,
+ "eval_num_tokens": 4483598.0,
+ "eval_runtime": 86.3006,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 1920
+ },
+ {
+ "entropy": 0.31626159623265265,
+ "epoch": 4.826899128268991,
+ "grad_norm": 0.8848487138748169,
+ "learning_rate": 0.00013961376213795132,
+ "loss": 0.2439030647277832,
+ "mean_token_accuracy": 0.9196575872600079,
+ "num_tokens": 4529201.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.826899128268991,
+ "eval_entropy": 0.388698436839636,
+ "eval_loss": 0.6000174283981323,
+ "eval_mean_token_accuracy": 0.8518068187458571,
+ "eval_num_tokens": 4529201.0,
+ "eval_runtime": 86.8979,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.979,
+ "step": 1940
+ },
+ {
+ "entropy": 0.30520407035946845,
+ "epoch": 4.876712328767123,
+ "grad_norm": 0.8532460927963257,
+ "learning_rate": 0.00013769957724166695,
+ "loss": 0.23458616733551024,
+ "mean_token_accuracy": 0.9221912942826748,
+ "num_tokens": 4578167.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.876712328767123,
+ "eval_entropy": 0.38777847102908203,
+ "eval_loss": 0.6004981398582458,
+ "eval_mean_token_accuracy": 0.8516481768253238,
+ "eval_num_tokens": 4578167.0,
+ "eval_runtime": 87.0777,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.975,
+ "step": 1960
+ },
+ {
+ "entropy": 0.3226448342204094,
+ "epoch": 4.926525529265255,
+ "grad_norm": 0.6945561766624451,
+ "learning_rate": 0.0001357779854299694,
+ "loss": 0.24048397541046143,
+ "mean_token_accuracy": 0.9195300146937371,
+ "num_tokens": 4622316.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.926525529265255,
+ "eval_entropy": 0.38581624263247777,
+ "eval_loss": 0.6029234528541565,
+ "eval_mean_token_accuracy": 0.8514213260523108,
+ "eval_num_tokens": 4622316.0,
+ "eval_runtime": 85.8729,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 1980
+ },
+ {
+ "entropy": 0.3051655298098922,
+ "epoch": 4.976338729763388,
+ "grad_norm": 0.7976452708244324,
+ "learning_rate": 0.00013384956622874001,
+ "loss": 0.23584742546081544,
+ "mean_token_accuracy": 0.9216851457953453,
+ "num_tokens": 4670746.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.976338729763388,
+ "eval_entropy": 0.37913159246361533,
+ "eval_loss": 0.6057604551315308,
+ "eval_mean_token_accuracy": 0.8525801203971686,
+ "eval_num_tokens": 4670746.0,
+ "eval_runtime": 86.1145,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2000
+ },
+ {
+ "entropy": 0.27438195240803254,
+ "epoch": 5.024906600249066,
+ "grad_norm": 0.6729586124420166,
+ "learning_rate": 0.0001319149012229075,
+ "loss": 0.19775952100753785,
+ "mean_token_accuracy": 0.9339428559327737,
+ "num_tokens": 4716176.0,
+ "step": 2020
+ },
+ {
+ "epoch": 5.024906600249066,
+ "eval_entropy": 0.3448961910813354,
+ "eval_loss": 0.6750120520591736,
+ "eval_mean_token_accuracy": 0.8487970232963562,
+ "eval_num_tokens": 4716176.0,
+ "eval_runtime": 86.1169,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2020
+ },
+ {
+ "entropy": 0.21423916313797237,
+ "epoch": 5.074719800747198,
+ "grad_norm": 0.6934391856193542,
+ "learning_rate": 0.00012997457388105022,
+ "loss": 0.1439570426940918,
+ "mean_token_accuracy": 0.9528236843645572,
+ "num_tokens": 4763269.0,
+ "step": 2040
+ },
+ {
+ "epoch": 5.074719800747198,
+ "eval_entropy": 0.3570949243771475,
+ "eval_loss": 0.6465504169464111,
+ "eval_mean_token_accuracy": 0.8490785547467166,
+ "eval_num_tokens": 4763269.0,
+ "eval_runtime": 85.9574,
+ "eval_samples_per_second": 15.996,
+ "eval_steps_per_second": 2.001,
+ "step": 2040
+ },
+ {
+ "entropy": 0.20838565267622472,
+ "epoch": 5.12453300124533,
+ "grad_norm": 0.7286986112594604,
+ "learning_rate": 0.00012802916937942972,
+ "loss": 0.14467307329177856,
+ "mean_token_accuracy": 0.950994835793972,
+ "num_tokens": 4809047.0,
+ "step": 2060
+ },
+ {
+ "epoch": 5.12453300124533,
+ "eval_entropy": 0.3452463157821533,
+ "eval_loss": 0.6705958843231201,
+ "eval_mean_token_accuracy": 0.8490352796953778,
+ "eval_num_tokens": 4809047.0,
+ "eval_runtime": 86.228,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 2060
+ },
+ {
+ "entropy": 0.20453082229942082,
+ "epoch": 5.174346201743462,
+ "grad_norm": 0.7515555620193481,
+ "learning_rate": 0.00012607927442550974,
+ "loss": 0.13732000589370727,
+ "mean_token_accuracy": 0.9537357829511166,
+ "num_tokens": 4857965.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.174346201743462,
+ "eval_entropy": 0.32431264914745506,
+ "eval_loss": 0.6743043065071106,
+ "eval_mean_token_accuracy": 0.8504878629085629,
+ "eval_num_tokens": 4857965.0,
+ "eval_runtime": 86.5948,
+ "eval_samples_per_second": 15.879,
+ "eval_steps_per_second": 1.986,
+ "step": 2080
+ },
+ {
+ "entropy": 0.21812320686876774,
+ "epoch": 5.224159402241594,
+ "grad_norm": 0.9093465209007263,
+ "learning_rate": 0.0001241254770810132,
+ "loss": 0.14311420917510986,
+ "mean_token_accuracy": 0.9514068141579628,
+ "num_tokens": 4905151.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.224159402241594,
+ "eval_entropy": 0.33086285835435225,
+ "eval_loss": 0.6676449179649353,
+ "eval_mean_token_accuracy": 0.8505287662495015,
+ "eval_num_tokens": 4905151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 2100
+ },
+ {
+ "entropy": 0.2180163251236081,
+ "epoch": 5.273972602739726,
+ "grad_norm": 0.6703007221221924,
+ "learning_rate": 0.00012216836658457075,
+ "loss": 0.14803968667984008,
+ "mean_token_accuracy": 0.9521303348243236,
+ "num_tokens": 4947072.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.273972602739726,
+ "eval_entropy": 0.33162341708707255,
+ "eval_loss": 0.6658875942230225,
+ "eval_mean_token_accuracy": 0.8500757605530495,
+ "eval_num_tokens": 4947072.0,
+ "eval_runtime": 86.6296,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 2120
+ },
+ {
+ "entropy": 0.22511130161583423,
+ "epoch": 5.323785803237858,
+ "grad_norm": 0.8078880906105042,
+ "learning_rate": 0.00012020853317401455,
+ "loss": 0.15228408575057983,
+ "mean_token_accuracy": 0.947144789993763,
+ "num_tokens": 4991974.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.323785803237858,
+ "eval_entropy": 0.3354601170434508,
+ "eval_loss": 0.6677829623222351,
+ "eval_mean_token_accuracy": 0.8482600024273229,
+ "eval_num_tokens": 4991974.0,
+ "eval_runtime": 86.4689,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.989,
+ "step": 2140
+ },
+ {
+ "entropy": 0.2244176059961319,
+ "epoch": 5.37359900373599,
+ "grad_norm": 0.9636075496673584,
+ "learning_rate": 0.00011824656790837037,
+ "loss": 0.15260883569717407,
+ "mean_token_accuracy": 0.9471467643976211,
+ "num_tokens": 5038400.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.37359900373599,
+ "eval_entropy": 0.3381616926297199,
+ "eval_loss": 0.6694412231445312,
+ "eval_mean_token_accuracy": 0.8482369603805764,
+ "eval_num_tokens": 5038400.0,
+ "eval_runtime": 86.4147,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 2160
+ },
+ {
+ "entropy": 0.22982364390045404,
+ "epoch": 5.423412204234122,
+ "grad_norm": 0.775401771068573,
+ "learning_rate": 0.00011628306248960262,
+ "loss": 0.15140302181243898,
+ "mean_token_accuracy": 0.9492553934454918,
+ "num_tokens": 5083166.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.423412204234122,
+ "eval_entropy": 0.3305150235808173,
+ "eval_loss": 0.6717822551727295,
+ "eval_mean_token_accuracy": 0.8489849723355715,
+ "eval_num_tokens": 5083166.0,
+ "eval_runtime": 86.4728,
+ "eval_samples_per_second": 15.901,
+ "eval_steps_per_second": 1.989,
+ "step": 2180
+ },
+ {
+ "entropy": 0.21448935717344284,
+ "epoch": 5.473225404732254,
+ "grad_norm": 0.6575281023979187,
+ "learning_rate": 0.00011431860908416465,
+ "loss": 0.1452319622039795,
+ "mean_token_accuracy": 0.9505287684500218,
+ "num_tokens": 5135109.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.473225404732254,
+ "eval_entropy": 0.3488145174328671,
+ "eval_loss": 0.6612305641174316,
+ "eval_mean_token_accuracy": 0.8492907808963642,
+ "eval_num_tokens": 5135109.0,
+ "eval_runtime": 86.6927,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 2200
+ },
+ {
+ "entropy": 0.23091202937066554,
+ "epoch": 5.523038605230386,
+ "grad_norm": 0.8909686207771301,
+ "learning_rate": 0.00011235380014440985,
+ "loss": 0.15150139331817628,
+ "mean_token_accuracy": 0.9497875183820724,
+ "num_tokens": 5180138.0,
+ "step": 2220
+ },
+ {
+ "epoch": 5.523038605230386,
+ "eval_entropy": 0.3268539015810157,
+ "eval_loss": 0.6667542457580566,
+ "eval_mean_token_accuracy": 0.8499062903398691,
+ "eval_num_tokens": 5180138.0,
+ "eval_runtime": 86.4644,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 2220
+ },
+ {
+ "entropy": 0.2227974807843566,
+ "epoch": 5.572851805728518,
+ "grad_norm": 0.6180275082588196,
+ "learning_rate": 0.0001103892282299158,
+ "loss": 0.1491069197654724,
+ "mean_token_accuracy": 0.9488144010305405,
+ "num_tokens": 5226864.0,
+ "step": 2240
+ },
+ {
+ "epoch": 5.572851805728518,
+ "eval_entropy": 0.3346347655494546,
+ "eval_loss": 0.6665948629379272,
+ "eval_mean_token_accuracy": 0.8499961893918903,
+ "eval_num_tokens": 5226864.0,
+ "eval_runtime": 87.0548,
+ "eval_samples_per_second": 15.795,
+ "eval_steps_per_second": 1.976,
+ "step": 2240
+ },
+ {
+ "entropy": 0.21368421968072654,
+ "epoch": 5.62266500622665,
+ "grad_norm": 0.6004369258880615,
+ "learning_rate": 0.00010842548582877651,
+ "loss": 0.14485255479812623,
+ "mean_token_accuracy": 0.9502056457102299,
+ "num_tokens": 5276602.0,
+ "step": 2260
+ },
+ {
+ "epoch": 5.62266500622665,
+ "eval_entropy": 0.32753298804163933,
+ "eval_loss": 0.6680151224136353,
+ "eval_mean_token_accuracy": 0.8515451086121936,
+ "eval_num_tokens": 5276602.0,
+ "eval_runtime": 86.8524,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.98,
+ "step": 2260
+ },
+ {
+ "entropy": 0.2103635374456644,
+ "epoch": 5.672478206724782,
+ "grad_norm": 0.699174702167511,
+ "learning_rate": 0.00010646316517891613,
+ "loss": 0.14297772645950318,
+ "mean_token_accuracy": 0.9512537539005279,
+ "num_tokens": 5323718.0,
+ "step": 2280
+ },
+ {
+ "epoch": 5.672478206724782,
+ "eval_entropy": 0.32966585959806,
+ "eval_loss": 0.675578773021698,
+ "eval_mean_token_accuracy": 0.8509623023659684,
+ "eval_num_tokens": 5323718.0,
+ "eval_runtime": 86.4518,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2280
+ },
+ {
+ "entropy": 0.22516900151968003,
+ "epoch": 5.722291407222914,
+ "grad_norm": 0.6637354493141174,
+ "learning_rate": 0.00010450285808947797,
+ "loss": 0.15202572345733642,
+ "mean_token_accuracy": 0.9482452072203159,
+ "num_tokens": 5369039.0,
+ "step": 2300
+ },
+ {
+ "epoch": 5.722291407222914,
+ "eval_entropy": 0.3369456917740578,
+ "eval_loss": 0.6697061061859131,
+ "eval_mean_token_accuracy": 0.848603522361711,
+ "eval_num_tokens": 5369039.0,
+ "eval_runtime": 86.6371,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.985,
+ "step": 2300
+ },
+ {
+ "entropy": 0.21841065725311637,
+ "epoch": 5.772104607721046,
+ "grad_norm": 0.7940268516540527,
+ "learning_rate": 0.00010254515576234297,
+ "loss": 0.14710167646408082,
+ "mean_token_accuracy": 0.9493498183786869,
+ "num_tokens": 5417029.0,
+ "step": 2320
+ },
+ {
+ "epoch": 5.772104607721046,
+ "eval_entropy": 0.3237486180177955,
+ "eval_loss": 0.6779657602310181,
+ "eval_mean_token_accuracy": 0.8500715313955794,
+ "eval_num_tokens": 5417029.0,
+ "eval_runtime": 86.1826,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 1.996,
+ "step": 2320
+ },
+ {
+ "entropy": 0.22146204356104135,
+ "epoch": 5.821917808219178,
+ "grad_norm": 0.9234833121299744,
+ "learning_rate": 0.00010059064861383132,
+ "loss": 0.14720046520233154,
+ "mean_token_accuracy": 0.9493872679769992,
+ "num_tokens": 5461671.0,
+ "step": 2340
+ },
+ {
+ "epoch": 5.821917808219178,
+ "eval_entropy": 0.32365207564692167,
+ "eval_loss": 0.6704005002975464,
+ "eval_mean_token_accuracy": 0.8507985760306203,
+ "eval_num_tokens": 5461671.0,
+ "eval_runtime": 86.5494,
+ "eval_samples_per_second": 15.887,
+ "eval_steps_per_second": 1.987,
+ "step": 2340
+ },
+ {
+ "entropy": 0.20934011954814197,
+ "epoch": 5.87173100871731,
+ "grad_norm": 0.5547503232955933,
+ "learning_rate": 9.863992609664084e-05,
+ "loss": 0.1464867353439331,
+ "mean_token_accuracy": 0.9503875687718392,
+ "num_tokens": 5509312.0,
+ "step": 2360
+ },
+ {
+ "epoch": 5.87173100871731,
+ "eval_entropy": 0.3330401429083458,
+ "eval_loss": 0.6659091114997864,
+ "eval_mean_token_accuracy": 0.8504848906467127,
+ "eval_num_tokens": 5509312.0,
+ "eval_runtime": 86.5855,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 2360
+ },
+ {
+ "entropy": 0.21678635366261007,
+ "epoch": 5.921544209215442,
+ "grad_norm": 0.570612907409668,
+ "learning_rate": 9.669357652207635e-05,
+ "loss": 0.14821385145187377,
+ "mean_token_accuracy": 0.9503940217196941,
+ "num_tokens": 5558196.0,
+ "step": 2380
+ },
+ {
+ "epoch": 5.921544209215442,
+ "eval_entropy": 0.3322022325077722,
+ "eval_loss": 0.6722489595413208,
+ "eval_mean_token_accuracy": 0.8489979422369669,
+ "eval_num_tokens": 5558196.0,
+ "eval_runtime": 86.2986,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 2380
+ },
+ {
+ "entropy": 0.20932920072227718,
+ "epoch": 5.971357409713574,
+ "grad_norm": 0.7879557609558105,
+ "learning_rate": 9.475218688262262e-05,
+ "loss": 0.14675841331481934,
+ "mean_token_accuracy": 0.9507176131010056,
+ "num_tokens": 5605400.0,
+ "step": 2400
+ },
+ {
+ "epoch": 5.971357409713574,
+ "eval_entropy": 0.3199348642902319,
+ "eval_loss": 0.6698136329650879,
+ "eval_mean_token_accuracy": 0.8514142130003419,
+ "eval_num_tokens": 5605400.0,
+ "eval_runtime": 85.8995,
+ "eval_samples_per_second": 16.007,
+ "eval_steps_per_second": 2.002,
+ "step": 2400
+ },
+ {
+ "entropy": 0.21032143919131693,
+ "epoch": 6.019925280199253,
+ "grad_norm": 0.5823076367378235,
+ "learning_rate": 9.281634267491569e-05,
+ "loss": 0.13322267532348633,
+ "mean_token_accuracy": 0.9550939072401096,
+ "num_tokens": 5648968.0,
+ "step": 2420
+ },
+ {
+ "epoch": 6.019925280199253,
+ "eval_entropy": 0.30206270117399303,
+ "eval_loss": 0.7093168497085571,
+ "eval_mean_token_accuracy": 0.8500627639681794,
+ "eval_num_tokens": 5648968.0,
+ "eval_runtime": 85.8128,
+ "eval_samples_per_second": 16.023,
+ "eval_steps_per_second": 2.004,
+ "step": 2420
+ },
+ {
+ "entropy": 0.1534628233872354,
+ "epoch": 6.069738480697385,
+ "grad_norm": 0.710133969783783,
+ "learning_rate": 9.088662772316508e-05,
+ "loss": 0.09078952670097351,
+ "mean_token_accuracy": 0.9678447999060154,
+ "num_tokens": 5697633.0,
+ "step": 2440
+ },
+ {
+ "epoch": 6.069738480697385,
+ "eval_entropy": 0.28208133101809857,
+ "eval_loss": 0.7636417150497437,
+ "eval_mean_token_accuracy": 0.8494061477655588,
+ "eval_num_tokens": 5697633.0,
+ "eval_runtime": 85.9724,
+ "eval_samples_per_second": 15.994,
+ "eval_steps_per_second": 2.001,
+ "step": 2440
+ },
+ {
+ "entropy": 0.16151462448760867,
+ "epoch": 6.119551681195516,
+ "grad_norm": 0.5793812274932861,
+ "learning_rate": 8.896362400308028e-05,
+ "loss": 0.09545697569847107,
+ "mean_token_accuracy": 0.9671573750674725,
+ "num_tokens": 5745090.0,
+ "step": 2460
+ },
+ {
+ "epoch": 6.119551681195516,
+ "eval_entropy": 0.2833245605403601,
+ "eval_loss": 0.7402405738830566,
+ "eval_mean_token_accuracy": 0.8503523728875226,
+ "eval_num_tokens": 5745090.0,
+ "eval_runtime": 85.5461,
+ "eval_samples_per_second": 16.073,
+ "eval_steps_per_second": 2.011,
+ "step": 2460
+ },
+ {
+ "entropy": 0.15203177919611335,
+ "epoch": 6.169364881693649,
+ "grad_norm": 0.4251123368740082,
+ "learning_rate": 8.704791146635483e-05,
+ "loss": 0.09420782327651978,
+ "mean_token_accuracy": 0.9677386932075024,
+ "num_tokens": 5790333.0,
+ "step": 2480
+ },
+ {
+ "epoch": 6.169364881693649,
+ "eval_entropy": 0.28572545962971313,
+ "eval_loss": 0.735416829586029,
+ "eval_mean_token_accuracy": 0.8487084663884584,
+ "eval_num_tokens": 5790333.0,
+ "eval_runtime": 85.4801,
+ "eval_samples_per_second": 16.086,
+ "eval_steps_per_second": 2.012,
+ "step": 2480
+ },
+ {
+ "entropy": 0.15587336672469973,
+ "epoch": 6.219178082191781,
+ "grad_norm": 0.4357028007507324,
+ "learning_rate": 8.514006786576085e-05,
+ "loss": 0.09429320096969604,
+ "mean_token_accuracy": 0.9682952925562859,
+ "num_tokens": 5837321.0,
+ "step": 2500
+ },
+ {
+ "epoch": 6.219178082191781,
+ "eval_entropy": 0.2859006894882335,
+ "eval_loss": 0.7347224950790405,
+ "eval_mean_token_accuracy": 0.8501905518215757,
+ "eval_num_tokens": 5837321.0,
+ "eval_runtime": 85.7578,
+ "eval_samples_per_second": 16.034,
+ "eval_steps_per_second": 2.006,
+ "step": 2500
+ },
+ {
+ "entropy": 0.15765639198943973,
+ "epoch": 6.268991282689913,
+ "grad_norm": 0.47331130504608154,
+ "learning_rate": 8.324066858090663e-05,
+ "loss": 0.09571113586425781,
+ "mean_token_accuracy": 0.9683481335639954,
+ "num_tokens": 5884398.0,
+ "step": 2520
+ },
+ {
+ "epoch": 6.268991282689913,
+ "eval_entropy": 0.29231513846059176,
+ "eval_loss": 0.7392512559890747,
+ "eval_mean_token_accuracy": 0.8486633983462356,
+ "eval_num_tokens": 5884398.0,
+ "eval_runtime": 85.7846,
+ "eval_samples_per_second": 16.029,
+ "eval_steps_per_second": 2.005,
+ "step": 2520
+ },
+ {
+ "entropy": 0.16176860257983208,
+ "epoch": 6.318804483188045,
+ "grad_norm": 0.6142018437385559,
+ "learning_rate": 8.135028644470992e-05,
+ "loss": 0.09486144185066223,
+ "mean_token_accuracy": 0.9682316601276397,
+ "num_tokens": 5929876.0,
+ "step": 2540
+ },
+ {
+ "epoch": 6.318804483188045,
+ "eval_entropy": 0.2851274753379267,
+ "eval_loss": 0.7520816922187805,
+ "eval_mean_token_accuracy": 0.8501113649717597,
+ "eval_num_tokens": 5929876.0,
+ "eval_runtime": 85.9425,
+ "eval_samples_per_second": 15.999,
+ "eval_steps_per_second": 2.001,
+ "step": 2540
+ },
+ {
+ "entropy": 0.15404034564271568,
+ "epoch": 6.3686176836861765,
+ "grad_norm": 0.6051287651062012,
+ "learning_rate": 7.946949157063964e-05,
+ "loss": 0.09280472993850708,
+ "mean_token_accuracy": 0.9684635892510414,
+ "num_tokens": 5978490.0,
+ "step": 2560
+ },
+ {
+ "epoch": 6.3686176836861765,
+ "eval_entropy": 0.28802703563557114,
+ "eval_loss": 0.7439162135124207,
+ "eval_mean_token_accuracy": 0.8499851770872293,
+ "eval_num_tokens": 5978490.0,
+ "eval_runtime": 86.0703,
+ "eval_samples_per_second": 15.975,
+ "eval_steps_per_second": 1.998,
+ "step": 2560
+ },
+ {
+ "entropy": 0.15343588953837753,
+ "epoch": 6.418430884184309,
+ "grad_norm": 0.4823743402957916,
+ "learning_rate": 7.759885118077701e-05,
+ "loss": 0.09000591039657593,
+ "mean_token_accuracy": 0.9699928767979145,
+ "num_tokens": 6025380.0,
+ "step": 2580
+ },
+ {
+ "epoch": 6.418430884184309,
+ "eval_entropy": 0.2795634938533916,
+ "eval_loss": 0.7647850513458252,
+ "eval_mean_token_accuracy": 0.8503464397995971,
+ "eval_num_tokens": 6025380.0,
+ "eval_runtime": 85.8886,
+ "eval_samples_per_second": 16.009,
+ "eval_steps_per_second": 2.003,
+ "step": 2580
+ },
+ {
+ "entropy": 0.15740026142448188,
+ "epoch": 6.468244084682441,
+ "grad_norm": 0.5082696676254272,
+ "learning_rate": 7.57389294347494e-05,
+ "loss": 0.09191849827766418,
+ "mean_token_accuracy": 0.9692809768021107,
+ "num_tokens": 6073349.0,
+ "step": 2600
+ },
+ {
+ "epoch": 6.468244084682441,
+ "eval_entropy": 0.2913342311458532,
+ "eval_loss": 0.7518694996833801,
+ "eval_mean_token_accuracy": 0.8483168302580367,
+ "eval_num_tokens": 6073349.0,
+ "eval_runtime": 85.5761,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.01,
+ "step": 2600
+ },
+ {
+ "entropy": 0.15922069251537324,
+ "epoch": 6.518057285180573,
+ "grad_norm": 0.3995199501514435,
+ "learning_rate": 7.389028725958736e-05,
+ "loss": 0.09584367871284485,
+ "mean_token_accuracy": 0.9685114495456218,
+ "num_tokens": 6118148.0,
+ "step": 2620
+ },
+ {
+ "epoch": 6.518057285180573,
+ "eval_entropy": 0.2863075934177221,
+ "eval_loss": 0.7539381384849548,
+ "eval_mean_token_accuracy": 0.8507507083027862,
+ "eval_num_tokens": 6118148.0,
+ "eval_runtime": 86.112,
+ "eval_samples_per_second": 15.968,
+ "eval_steps_per_second": 1.997,
+ "step": 2620
+ },
+ {
+ "entropy": 0.16197575423866512,
+ "epoch": 6.567870485678705,
+ "grad_norm": 0.534295380115509,
+ "learning_rate": 7.205348218055678e-05,
+ "loss": 0.0961170256137848,
+ "mean_token_accuracy": 0.9674530044198036,
+ "num_tokens": 6165523.0,
+ "step": 2640
+ },
+ {
+ "epoch": 6.567870485678705,
+ "eval_entropy": 0.29021967315050057,
+ "eval_loss": 0.751198947429657,
+ "eval_mean_token_accuracy": 0.8509796344956686,
+ "eval_num_tokens": 6165523.0,
+ "eval_runtime": 85.7958,
+ "eval_samples_per_second": 16.026,
+ "eval_steps_per_second": 2.005,
+ "step": 2640
+ },
+ {
+ "entropy": 0.15261746793985367,
+ "epoch": 6.617683686176837,
+ "grad_norm": 0.5391237139701843,
+ "learning_rate": 7.022906815301673e-05,
+ "loss": 0.0926026999950409,
+ "mean_token_accuracy": 0.9695659473538398,
+ "num_tokens": 6216232.0,
+ "step": 2660
+ },
+ {
+ "epoch": 6.617683686176837,
+ "eval_entropy": 0.29128045216202736,
+ "eval_loss": 0.7450292110443115,
+ "eval_mean_token_accuracy": 0.8498771443616512,
+ "eval_num_tokens": 6216232.0,
+ "eval_runtime": 86.3963,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 2660
+ },
+ {
+ "entropy": 0.16164180357009172,
+ "epoch": 6.667496886674969,
+ "grad_norm": 0.5767946243286133,
+ "learning_rate": 6.841759539535419e-05,
+ "loss": 0.09291981458663941,
+ "mean_token_accuracy": 0.9687136687338352,
+ "num_tokens": 6264807.0,
+ "step": 2680
+ },
+ {
+ "epoch": 6.667496886674969,
+ "eval_entropy": 0.2897637223088464,
+ "eval_loss": 0.7503410577774048,
+ "eval_mean_token_accuracy": 0.8503315164599308,
+ "eval_num_tokens": 6264807.0,
+ "eval_runtime": 86.0653,
+ "eval_samples_per_second": 15.976,
+ "eval_steps_per_second": 1.998,
+ "step": 2680
+ },
+ {
+ "entropy": 0.17062523355707526,
+ "epoch": 6.717310087173101,
+ "grad_norm": 0.4974168539047241,
+ "learning_rate": 6.661961022304563e-05,
+ "loss": 0.09713236689567566,
+ "mean_token_accuracy": 0.9661971725523472,
+ "num_tokens": 6308819.0,
+ "step": 2700
+ },
+ {
+ "epoch": 6.717310087173101,
+ "eval_entropy": 0.2765843396963075,
+ "eval_loss": 0.7604002356529236,
+ "eval_mean_token_accuracy": 0.8521115277395692,
+ "eval_num_tokens": 6308819.0,
+ "eval_runtime": 86.1676,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 2700
+ },
+ {
+ "entropy": 0.17544092936441302,
+ "epoch": 6.767123287671232,
+ "grad_norm": 0.5523537993431091,
+ "learning_rate": 6.483565488389582e-05,
+ "loss": 0.09709116220474243,
+ "mean_token_accuracy": 0.9650957375764847,
+ "num_tokens": 6352548.0,
+ "step": 2720
+ },
+ {
+ "epoch": 6.767123287671232,
+ "eval_entropy": 0.27939334659035814,
+ "eval_loss": 0.7534670829772949,
+ "eval_mean_token_accuracy": 0.851230604010959,
+ "eval_num_tokens": 6352548.0,
+ "eval_runtime": 86.2913,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 2720
+ },
+ {
+ "entropy": 0.15991022661328316,
+ "epoch": 6.816936488169365,
+ "grad_norm": 0.478551983833313,
+ "learning_rate": 6.306626739450311e-05,
+ "loss": 0.09564646482467651,
+ "mean_token_accuracy": 0.9679084822535515,
+ "num_tokens": 6397720.0,
+ "step": 2740
+ },
+ {
+ "epoch": 6.816936488169365,
+ "eval_entropy": 0.27878295491601146,
+ "eval_loss": 0.7519959211349487,
+ "eval_mean_token_accuracy": 0.8510654949864676,
+ "eval_num_tokens": 6397720.0,
+ "eval_runtime": 85.9109,
+ "eval_samples_per_second": 16.005,
+ "eval_steps_per_second": 2.002,
+ "step": 2740
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.697999873298944e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2760/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2760/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2760/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2760/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2760/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2760/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2760/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2760/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2760/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2760/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2760/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2760/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2760/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2760/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..b8ab7a7bcb3fd23ade407a4001bcb64c2375cd2d
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2760/trainer_state.json
@@ -0,0 +1,2932 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 6.866749688667497,
+ "eval_steps": 20,
+ "global_step": 2760,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ },
+ {
+ "entropy": 0.3193941755220294,
+ "epoch": 4.5280199252802,
+ "grad_norm": 0.8281906843185425,
+ "learning_rate": 0.0001509111761786888,
+ "loss": 0.23936262130737304,
+ "mean_token_accuracy": 0.9201708927750587,
+ "num_tokens": 4244423.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.5280199252802,
+ "eval_entropy": 0.38704028864239537,
+ "eval_loss": 0.6006569266319275,
+ "eval_mean_token_accuracy": 0.8502406720505205,
+ "eval_num_tokens": 4244423.0,
+ "eval_runtime": 86.8059,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1820
+ },
+ {
+ "entropy": 0.3164879363030195,
+ "epoch": 4.577833125778331,
+ "grad_norm": 0.7892968654632568,
+ "learning_rate": 0.00014905346557909867,
+ "loss": 0.24541733264923096,
+ "mean_token_accuracy": 0.9175932116806507,
+ "num_tokens": 4289773.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.577833125778331,
+ "eval_entropy": 0.38861122120951497,
+ "eval_loss": 0.6115967631340027,
+ "eval_mean_token_accuracy": 0.849471275196519,
+ "eval_num_tokens": 4289773.0,
+ "eval_runtime": 86.2946,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1840
+ },
+ {
+ "entropy": 0.3051785985007882,
+ "epoch": 4.627646326276463,
+ "grad_norm": 0.8109654188156128,
+ "learning_rate": 0.0001471849238862319,
+ "loss": 0.23433220386505127,
+ "mean_token_accuracy": 0.9206570319831371,
+ "num_tokens": 4336894.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.627646326276463,
+ "eval_entropy": 0.37162452295076015,
+ "eval_loss": 0.6184061765670776,
+ "eval_mean_token_accuracy": 0.8501173268223918,
+ "eval_num_tokens": 4336894.0,
+ "eval_runtime": 86.6865,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1860
+ },
+ {
+ "entropy": 0.3168198253959417,
+ "epoch": 4.677459526774595,
+ "grad_norm": 0.9512342214584351,
+ "learning_rate": 0.0001453061146267775,
+ "loss": 0.23832404613494873,
+ "mean_token_accuracy": 0.9197044663131237,
+ "num_tokens": 4382947.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.677459526774595,
+ "eval_entropy": 0.3845940856912801,
+ "eval_loss": 0.606762707233429,
+ "eval_mean_token_accuracy": 0.8504838194957999,
+ "eval_num_tokens": 4382947.0,
+ "eval_runtime": 86.5175,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 1880
+ },
+ {
+ "entropy": 0.30791807882487776,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 0.8123113512992859,
+ "learning_rate": 0.00014341760442398248,
+ "loss": 0.2395785331726074,
+ "mean_token_accuracy": 0.918928150832653,
+ "num_tokens": 4433050.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.7272727272727275,
+ "eval_entropy": 0.39762327222283494,
+ "eval_loss": 0.5994202494621277,
+ "eval_mean_token_accuracy": 0.8509274201337681,
+ "eval_num_tokens": 4433050.0,
+ "eval_runtime": 86.2873,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.993,
+ "step": 1900
+ },
+ {
+ "entropy": 0.3021434534341097,
+ "epoch": 4.777085927770859,
+ "grad_norm": 0.731787383556366,
+ "learning_rate": 0.000141519962826766,
+ "loss": 0.23494718074798585,
+ "mean_token_accuracy": 0.9201403826475143,
+ "num_tokens": 4483598.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.777085927770859,
+ "eval_entropy": 0.3827026732439219,
+ "eval_loss": 0.5995895862579346,
+ "eval_mean_token_accuracy": 0.851468373523202,
+ "eval_num_tokens": 4483598.0,
+ "eval_runtime": 86.3006,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 1920
+ },
+ {
+ "entropy": 0.31626159623265265,
+ "epoch": 4.826899128268991,
+ "grad_norm": 0.8848487138748169,
+ "learning_rate": 0.00013961376213795132,
+ "loss": 0.2439030647277832,
+ "mean_token_accuracy": 0.9196575872600079,
+ "num_tokens": 4529201.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.826899128268991,
+ "eval_entropy": 0.388698436839636,
+ "eval_loss": 0.6000174283981323,
+ "eval_mean_token_accuracy": 0.8518068187458571,
+ "eval_num_tokens": 4529201.0,
+ "eval_runtime": 86.8979,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.979,
+ "step": 1940
+ },
+ {
+ "entropy": 0.30520407035946845,
+ "epoch": 4.876712328767123,
+ "grad_norm": 0.8532460927963257,
+ "learning_rate": 0.00013769957724166695,
+ "loss": 0.23458616733551024,
+ "mean_token_accuracy": 0.9221912942826748,
+ "num_tokens": 4578167.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.876712328767123,
+ "eval_entropy": 0.38777847102908203,
+ "eval_loss": 0.6004981398582458,
+ "eval_mean_token_accuracy": 0.8516481768253238,
+ "eval_num_tokens": 4578167.0,
+ "eval_runtime": 87.0777,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.975,
+ "step": 1960
+ },
+ {
+ "entropy": 0.3226448342204094,
+ "epoch": 4.926525529265255,
+ "grad_norm": 0.6945561766624451,
+ "learning_rate": 0.0001357779854299694,
+ "loss": 0.24048397541046143,
+ "mean_token_accuracy": 0.9195300146937371,
+ "num_tokens": 4622316.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.926525529265255,
+ "eval_entropy": 0.38581624263247777,
+ "eval_loss": 0.6029234528541565,
+ "eval_mean_token_accuracy": 0.8514213260523108,
+ "eval_num_tokens": 4622316.0,
+ "eval_runtime": 85.8729,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 1980
+ },
+ {
+ "entropy": 0.3051655298098922,
+ "epoch": 4.976338729763388,
+ "grad_norm": 0.7976452708244324,
+ "learning_rate": 0.00013384956622874001,
+ "loss": 0.23584742546081544,
+ "mean_token_accuracy": 0.9216851457953453,
+ "num_tokens": 4670746.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.976338729763388,
+ "eval_entropy": 0.37913159246361533,
+ "eval_loss": 0.6057604551315308,
+ "eval_mean_token_accuracy": 0.8525801203971686,
+ "eval_num_tokens": 4670746.0,
+ "eval_runtime": 86.1145,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2000
+ },
+ {
+ "entropy": 0.27438195240803254,
+ "epoch": 5.024906600249066,
+ "grad_norm": 0.6729586124420166,
+ "learning_rate": 0.0001319149012229075,
+ "loss": 0.19775952100753785,
+ "mean_token_accuracy": 0.9339428559327737,
+ "num_tokens": 4716176.0,
+ "step": 2020
+ },
+ {
+ "epoch": 5.024906600249066,
+ "eval_entropy": 0.3448961910813354,
+ "eval_loss": 0.6750120520591736,
+ "eval_mean_token_accuracy": 0.8487970232963562,
+ "eval_num_tokens": 4716176.0,
+ "eval_runtime": 86.1169,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2020
+ },
+ {
+ "entropy": 0.21423916313797237,
+ "epoch": 5.074719800747198,
+ "grad_norm": 0.6934391856193542,
+ "learning_rate": 0.00012997457388105022,
+ "loss": 0.1439570426940918,
+ "mean_token_accuracy": 0.9528236843645572,
+ "num_tokens": 4763269.0,
+ "step": 2040
+ },
+ {
+ "epoch": 5.074719800747198,
+ "eval_entropy": 0.3570949243771475,
+ "eval_loss": 0.6465504169464111,
+ "eval_mean_token_accuracy": 0.8490785547467166,
+ "eval_num_tokens": 4763269.0,
+ "eval_runtime": 85.9574,
+ "eval_samples_per_second": 15.996,
+ "eval_steps_per_second": 2.001,
+ "step": 2040
+ },
+ {
+ "entropy": 0.20838565267622472,
+ "epoch": 5.12453300124533,
+ "grad_norm": 0.7286986112594604,
+ "learning_rate": 0.00012802916937942972,
+ "loss": 0.14467307329177856,
+ "mean_token_accuracy": 0.950994835793972,
+ "num_tokens": 4809047.0,
+ "step": 2060
+ },
+ {
+ "epoch": 5.12453300124533,
+ "eval_entropy": 0.3452463157821533,
+ "eval_loss": 0.6705958843231201,
+ "eval_mean_token_accuracy": 0.8490352796953778,
+ "eval_num_tokens": 4809047.0,
+ "eval_runtime": 86.228,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 2060
+ },
+ {
+ "entropy": 0.20453082229942082,
+ "epoch": 5.174346201743462,
+ "grad_norm": 0.7515555620193481,
+ "learning_rate": 0.00012607927442550974,
+ "loss": 0.13732000589370727,
+ "mean_token_accuracy": 0.9537357829511166,
+ "num_tokens": 4857965.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.174346201743462,
+ "eval_entropy": 0.32431264914745506,
+ "eval_loss": 0.6743043065071106,
+ "eval_mean_token_accuracy": 0.8504878629085629,
+ "eval_num_tokens": 4857965.0,
+ "eval_runtime": 86.5948,
+ "eval_samples_per_second": 15.879,
+ "eval_steps_per_second": 1.986,
+ "step": 2080
+ },
+ {
+ "entropy": 0.21812320686876774,
+ "epoch": 5.224159402241594,
+ "grad_norm": 0.9093465209007263,
+ "learning_rate": 0.0001241254770810132,
+ "loss": 0.14311420917510986,
+ "mean_token_accuracy": 0.9514068141579628,
+ "num_tokens": 4905151.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.224159402241594,
+ "eval_entropy": 0.33086285835435225,
+ "eval_loss": 0.6676449179649353,
+ "eval_mean_token_accuracy": 0.8505287662495015,
+ "eval_num_tokens": 4905151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 2100
+ },
+ {
+ "entropy": 0.2180163251236081,
+ "epoch": 5.273972602739726,
+ "grad_norm": 0.6703007221221924,
+ "learning_rate": 0.00012216836658457075,
+ "loss": 0.14803968667984008,
+ "mean_token_accuracy": 0.9521303348243236,
+ "num_tokens": 4947072.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.273972602739726,
+ "eval_entropy": 0.33162341708707255,
+ "eval_loss": 0.6658875942230225,
+ "eval_mean_token_accuracy": 0.8500757605530495,
+ "eval_num_tokens": 4947072.0,
+ "eval_runtime": 86.6296,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 2120
+ },
+ {
+ "entropy": 0.22511130161583423,
+ "epoch": 5.323785803237858,
+ "grad_norm": 0.8078880906105042,
+ "learning_rate": 0.00012020853317401455,
+ "loss": 0.15228408575057983,
+ "mean_token_accuracy": 0.947144789993763,
+ "num_tokens": 4991974.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.323785803237858,
+ "eval_entropy": 0.3354601170434508,
+ "eval_loss": 0.6677829623222351,
+ "eval_mean_token_accuracy": 0.8482600024273229,
+ "eval_num_tokens": 4991974.0,
+ "eval_runtime": 86.4689,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.989,
+ "step": 2140
+ },
+ {
+ "entropy": 0.2244176059961319,
+ "epoch": 5.37359900373599,
+ "grad_norm": 0.9636075496673584,
+ "learning_rate": 0.00011824656790837037,
+ "loss": 0.15260883569717407,
+ "mean_token_accuracy": 0.9471467643976211,
+ "num_tokens": 5038400.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.37359900373599,
+ "eval_entropy": 0.3381616926297199,
+ "eval_loss": 0.6694412231445312,
+ "eval_mean_token_accuracy": 0.8482369603805764,
+ "eval_num_tokens": 5038400.0,
+ "eval_runtime": 86.4147,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 2160
+ },
+ {
+ "entropy": 0.22982364390045404,
+ "epoch": 5.423412204234122,
+ "grad_norm": 0.775401771068573,
+ "learning_rate": 0.00011628306248960262,
+ "loss": 0.15140302181243898,
+ "mean_token_accuracy": 0.9492553934454918,
+ "num_tokens": 5083166.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.423412204234122,
+ "eval_entropy": 0.3305150235808173,
+ "eval_loss": 0.6717822551727295,
+ "eval_mean_token_accuracy": 0.8489849723355715,
+ "eval_num_tokens": 5083166.0,
+ "eval_runtime": 86.4728,
+ "eval_samples_per_second": 15.901,
+ "eval_steps_per_second": 1.989,
+ "step": 2180
+ },
+ {
+ "entropy": 0.21448935717344284,
+ "epoch": 5.473225404732254,
+ "grad_norm": 0.6575281023979187,
+ "learning_rate": 0.00011431860908416465,
+ "loss": 0.1452319622039795,
+ "mean_token_accuracy": 0.9505287684500218,
+ "num_tokens": 5135109.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.473225404732254,
+ "eval_entropy": 0.3488145174328671,
+ "eval_loss": 0.6612305641174316,
+ "eval_mean_token_accuracy": 0.8492907808963642,
+ "eval_num_tokens": 5135109.0,
+ "eval_runtime": 86.6927,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 2200
+ },
+ {
+ "entropy": 0.23091202937066554,
+ "epoch": 5.523038605230386,
+ "grad_norm": 0.8909686207771301,
+ "learning_rate": 0.00011235380014440985,
+ "loss": 0.15150139331817628,
+ "mean_token_accuracy": 0.9497875183820724,
+ "num_tokens": 5180138.0,
+ "step": 2220
+ },
+ {
+ "epoch": 5.523038605230386,
+ "eval_entropy": 0.3268539015810157,
+ "eval_loss": 0.6667542457580566,
+ "eval_mean_token_accuracy": 0.8499062903398691,
+ "eval_num_tokens": 5180138.0,
+ "eval_runtime": 86.4644,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 2220
+ },
+ {
+ "entropy": 0.2227974807843566,
+ "epoch": 5.572851805728518,
+ "grad_norm": 0.6180275082588196,
+ "learning_rate": 0.0001103892282299158,
+ "loss": 0.1491069197654724,
+ "mean_token_accuracy": 0.9488144010305405,
+ "num_tokens": 5226864.0,
+ "step": 2240
+ },
+ {
+ "epoch": 5.572851805728518,
+ "eval_entropy": 0.3346347655494546,
+ "eval_loss": 0.6665948629379272,
+ "eval_mean_token_accuracy": 0.8499961893918903,
+ "eval_num_tokens": 5226864.0,
+ "eval_runtime": 87.0548,
+ "eval_samples_per_second": 15.795,
+ "eval_steps_per_second": 1.976,
+ "step": 2240
+ },
+ {
+ "entropy": 0.21368421968072654,
+ "epoch": 5.62266500622665,
+ "grad_norm": 0.6004369258880615,
+ "learning_rate": 0.00010842548582877651,
+ "loss": 0.14485255479812623,
+ "mean_token_accuracy": 0.9502056457102299,
+ "num_tokens": 5276602.0,
+ "step": 2260
+ },
+ {
+ "epoch": 5.62266500622665,
+ "eval_entropy": 0.32753298804163933,
+ "eval_loss": 0.6680151224136353,
+ "eval_mean_token_accuracy": 0.8515451086121936,
+ "eval_num_tokens": 5276602.0,
+ "eval_runtime": 86.8524,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.98,
+ "step": 2260
+ },
+ {
+ "entropy": 0.2103635374456644,
+ "epoch": 5.672478206724782,
+ "grad_norm": 0.699174702167511,
+ "learning_rate": 0.00010646316517891613,
+ "loss": 0.14297772645950318,
+ "mean_token_accuracy": 0.9512537539005279,
+ "num_tokens": 5323718.0,
+ "step": 2280
+ },
+ {
+ "epoch": 5.672478206724782,
+ "eval_entropy": 0.32966585959806,
+ "eval_loss": 0.675578773021698,
+ "eval_mean_token_accuracy": 0.8509623023659684,
+ "eval_num_tokens": 5323718.0,
+ "eval_runtime": 86.4518,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2280
+ },
+ {
+ "entropy": 0.22516900151968003,
+ "epoch": 5.722291407222914,
+ "grad_norm": 0.6637354493141174,
+ "learning_rate": 0.00010450285808947797,
+ "loss": 0.15202572345733642,
+ "mean_token_accuracy": 0.9482452072203159,
+ "num_tokens": 5369039.0,
+ "step": 2300
+ },
+ {
+ "epoch": 5.722291407222914,
+ "eval_entropy": 0.3369456917740578,
+ "eval_loss": 0.6697061061859131,
+ "eval_mean_token_accuracy": 0.848603522361711,
+ "eval_num_tokens": 5369039.0,
+ "eval_runtime": 86.6371,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.985,
+ "step": 2300
+ },
+ {
+ "entropy": 0.21841065725311637,
+ "epoch": 5.772104607721046,
+ "grad_norm": 0.7940268516540527,
+ "learning_rate": 0.00010254515576234297,
+ "loss": 0.14710167646408082,
+ "mean_token_accuracy": 0.9493498183786869,
+ "num_tokens": 5417029.0,
+ "step": 2320
+ },
+ {
+ "epoch": 5.772104607721046,
+ "eval_entropy": 0.3237486180177955,
+ "eval_loss": 0.6779657602310181,
+ "eval_mean_token_accuracy": 0.8500715313955794,
+ "eval_num_tokens": 5417029.0,
+ "eval_runtime": 86.1826,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 1.996,
+ "step": 2320
+ },
+ {
+ "entropy": 0.22146204356104135,
+ "epoch": 5.821917808219178,
+ "grad_norm": 0.9234833121299744,
+ "learning_rate": 0.00010059064861383132,
+ "loss": 0.14720046520233154,
+ "mean_token_accuracy": 0.9493872679769992,
+ "num_tokens": 5461671.0,
+ "step": 2340
+ },
+ {
+ "epoch": 5.821917808219178,
+ "eval_entropy": 0.32365207564692167,
+ "eval_loss": 0.6704005002975464,
+ "eval_mean_token_accuracy": 0.8507985760306203,
+ "eval_num_tokens": 5461671.0,
+ "eval_runtime": 86.5494,
+ "eval_samples_per_second": 15.887,
+ "eval_steps_per_second": 1.987,
+ "step": 2340
+ },
+ {
+ "entropy": 0.20934011954814197,
+ "epoch": 5.87173100871731,
+ "grad_norm": 0.5547503232955933,
+ "learning_rate": 9.863992609664084e-05,
+ "loss": 0.1464867353439331,
+ "mean_token_accuracy": 0.9503875687718392,
+ "num_tokens": 5509312.0,
+ "step": 2360
+ },
+ {
+ "epoch": 5.87173100871731,
+ "eval_entropy": 0.3330401429083458,
+ "eval_loss": 0.6659091114997864,
+ "eval_mean_token_accuracy": 0.8504848906467127,
+ "eval_num_tokens": 5509312.0,
+ "eval_runtime": 86.5855,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 2360
+ },
+ {
+ "entropy": 0.21678635366261007,
+ "epoch": 5.921544209215442,
+ "grad_norm": 0.570612907409668,
+ "learning_rate": 9.669357652207635e-05,
+ "loss": 0.14821385145187377,
+ "mean_token_accuracy": 0.9503940217196941,
+ "num_tokens": 5558196.0,
+ "step": 2380
+ },
+ {
+ "epoch": 5.921544209215442,
+ "eval_entropy": 0.3322022325077722,
+ "eval_loss": 0.6722489595413208,
+ "eval_mean_token_accuracy": 0.8489979422369669,
+ "eval_num_tokens": 5558196.0,
+ "eval_runtime": 86.2986,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 2380
+ },
+ {
+ "entropy": 0.20932920072227718,
+ "epoch": 5.971357409713574,
+ "grad_norm": 0.7879557609558105,
+ "learning_rate": 9.475218688262262e-05,
+ "loss": 0.14675841331481934,
+ "mean_token_accuracy": 0.9507176131010056,
+ "num_tokens": 5605400.0,
+ "step": 2400
+ },
+ {
+ "epoch": 5.971357409713574,
+ "eval_entropy": 0.3199348642902319,
+ "eval_loss": 0.6698136329650879,
+ "eval_mean_token_accuracy": 0.8514142130003419,
+ "eval_num_tokens": 5605400.0,
+ "eval_runtime": 85.8995,
+ "eval_samples_per_second": 16.007,
+ "eval_steps_per_second": 2.002,
+ "step": 2400
+ },
+ {
+ "entropy": 0.21032143919131693,
+ "epoch": 6.019925280199253,
+ "grad_norm": 0.5823076367378235,
+ "learning_rate": 9.281634267491569e-05,
+ "loss": 0.13322267532348633,
+ "mean_token_accuracy": 0.9550939072401096,
+ "num_tokens": 5648968.0,
+ "step": 2420
+ },
+ {
+ "epoch": 6.019925280199253,
+ "eval_entropy": 0.30206270117399303,
+ "eval_loss": 0.7093168497085571,
+ "eval_mean_token_accuracy": 0.8500627639681794,
+ "eval_num_tokens": 5648968.0,
+ "eval_runtime": 85.8128,
+ "eval_samples_per_second": 16.023,
+ "eval_steps_per_second": 2.004,
+ "step": 2420
+ },
+ {
+ "entropy": 0.1534628233872354,
+ "epoch": 6.069738480697385,
+ "grad_norm": 0.710133969783783,
+ "learning_rate": 9.088662772316508e-05,
+ "loss": 0.09078952670097351,
+ "mean_token_accuracy": 0.9678447999060154,
+ "num_tokens": 5697633.0,
+ "step": 2440
+ },
+ {
+ "epoch": 6.069738480697385,
+ "eval_entropy": 0.28208133101809857,
+ "eval_loss": 0.7636417150497437,
+ "eval_mean_token_accuracy": 0.8494061477655588,
+ "eval_num_tokens": 5697633.0,
+ "eval_runtime": 85.9724,
+ "eval_samples_per_second": 15.994,
+ "eval_steps_per_second": 2.001,
+ "step": 2440
+ },
+ {
+ "entropy": 0.16151462448760867,
+ "epoch": 6.119551681195516,
+ "grad_norm": 0.5793812274932861,
+ "learning_rate": 8.896362400308028e-05,
+ "loss": 0.09545697569847107,
+ "mean_token_accuracy": 0.9671573750674725,
+ "num_tokens": 5745090.0,
+ "step": 2460
+ },
+ {
+ "epoch": 6.119551681195516,
+ "eval_entropy": 0.2833245605403601,
+ "eval_loss": 0.7402405738830566,
+ "eval_mean_token_accuracy": 0.8503523728875226,
+ "eval_num_tokens": 5745090.0,
+ "eval_runtime": 85.5461,
+ "eval_samples_per_second": 16.073,
+ "eval_steps_per_second": 2.011,
+ "step": 2460
+ },
+ {
+ "entropy": 0.15203177919611335,
+ "epoch": 6.169364881693649,
+ "grad_norm": 0.4251123368740082,
+ "learning_rate": 8.704791146635483e-05,
+ "loss": 0.09420782327651978,
+ "mean_token_accuracy": 0.9677386932075024,
+ "num_tokens": 5790333.0,
+ "step": 2480
+ },
+ {
+ "epoch": 6.169364881693649,
+ "eval_entropy": 0.28572545962971313,
+ "eval_loss": 0.735416829586029,
+ "eval_mean_token_accuracy": 0.8487084663884584,
+ "eval_num_tokens": 5790333.0,
+ "eval_runtime": 85.4801,
+ "eval_samples_per_second": 16.086,
+ "eval_steps_per_second": 2.012,
+ "step": 2480
+ },
+ {
+ "entropy": 0.15587336672469973,
+ "epoch": 6.219178082191781,
+ "grad_norm": 0.4357028007507324,
+ "learning_rate": 8.514006786576085e-05,
+ "loss": 0.09429320096969604,
+ "mean_token_accuracy": 0.9682952925562859,
+ "num_tokens": 5837321.0,
+ "step": 2500
+ },
+ {
+ "epoch": 6.219178082191781,
+ "eval_entropy": 0.2859006894882335,
+ "eval_loss": 0.7347224950790405,
+ "eval_mean_token_accuracy": 0.8501905518215757,
+ "eval_num_tokens": 5837321.0,
+ "eval_runtime": 85.7578,
+ "eval_samples_per_second": 16.034,
+ "eval_steps_per_second": 2.006,
+ "step": 2500
+ },
+ {
+ "entropy": 0.15765639198943973,
+ "epoch": 6.268991282689913,
+ "grad_norm": 0.47331130504608154,
+ "learning_rate": 8.324066858090663e-05,
+ "loss": 0.09571113586425781,
+ "mean_token_accuracy": 0.9683481335639954,
+ "num_tokens": 5884398.0,
+ "step": 2520
+ },
+ {
+ "epoch": 6.268991282689913,
+ "eval_entropy": 0.29231513846059176,
+ "eval_loss": 0.7392512559890747,
+ "eval_mean_token_accuracy": 0.8486633983462356,
+ "eval_num_tokens": 5884398.0,
+ "eval_runtime": 85.7846,
+ "eval_samples_per_second": 16.029,
+ "eval_steps_per_second": 2.005,
+ "step": 2520
+ },
+ {
+ "entropy": 0.16176860257983208,
+ "epoch": 6.318804483188045,
+ "grad_norm": 0.6142018437385559,
+ "learning_rate": 8.135028644470992e-05,
+ "loss": 0.09486144185066223,
+ "mean_token_accuracy": 0.9682316601276397,
+ "num_tokens": 5929876.0,
+ "step": 2540
+ },
+ {
+ "epoch": 6.318804483188045,
+ "eval_entropy": 0.2851274753379267,
+ "eval_loss": 0.7520816922187805,
+ "eval_mean_token_accuracy": 0.8501113649717597,
+ "eval_num_tokens": 5929876.0,
+ "eval_runtime": 85.9425,
+ "eval_samples_per_second": 15.999,
+ "eval_steps_per_second": 2.001,
+ "step": 2540
+ },
+ {
+ "entropy": 0.15404034564271568,
+ "epoch": 6.3686176836861765,
+ "grad_norm": 0.6051287651062012,
+ "learning_rate": 7.946949157063964e-05,
+ "loss": 0.09280472993850708,
+ "mean_token_accuracy": 0.9684635892510414,
+ "num_tokens": 5978490.0,
+ "step": 2560
+ },
+ {
+ "epoch": 6.3686176836861765,
+ "eval_entropy": 0.28802703563557114,
+ "eval_loss": 0.7439162135124207,
+ "eval_mean_token_accuracy": 0.8499851770872293,
+ "eval_num_tokens": 5978490.0,
+ "eval_runtime": 86.0703,
+ "eval_samples_per_second": 15.975,
+ "eval_steps_per_second": 1.998,
+ "step": 2560
+ },
+ {
+ "entropy": 0.15343588953837753,
+ "epoch": 6.418430884184309,
+ "grad_norm": 0.4823743402957916,
+ "learning_rate": 7.759885118077701e-05,
+ "loss": 0.09000591039657593,
+ "mean_token_accuracy": 0.9699928767979145,
+ "num_tokens": 6025380.0,
+ "step": 2580
+ },
+ {
+ "epoch": 6.418430884184309,
+ "eval_entropy": 0.2795634938533916,
+ "eval_loss": 0.7647850513458252,
+ "eval_mean_token_accuracy": 0.8503464397995971,
+ "eval_num_tokens": 6025380.0,
+ "eval_runtime": 85.8886,
+ "eval_samples_per_second": 16.009,
+ "eval_steps_per_second": 2.003,
+ "step": 2580
+ },
+ {
+ "entropy": 0.15740026142448188,
+ "epoch": 6.468244084682441,
+ "grad_norm": 0.5082696676254272,
+ "learning_rate": 7.57389294347494e-05,
+ "loss": 0.09191849827766418,
+ "mean_token_accuracy": 0.9692809768021107,
+ "num_tokens": 6073349.0,
+ "step": 2600
+ },
+ {
+ "epoch": 6.468244084682441,
+ "eval_entropy": 0.2913342311458532,
+ "eval_loss": 0.7518694996833801,
+ "eval_mean_token_accuracy": 0.8483168302580367,
+ "eval_num_tokens": 6073349.0,
+ "eval_runtime": 85.5761,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.01,
+ "step": 2600
+ },
+ {
+ "entropy": 0.15922069251537324,
+ "epoch": 6.518057285180573,
+ "grad_norm": 0.3995199501514435,
+ "learning_rate": 7.389028725958736e-05,
+ "loss": 0.09584367871284485,
+ "mean_token_accuracy": 0.9685114495456218,
+ "num_tokens": 6118148.0,
+ "step": 2620
+ },
+ {
+ "epoch": 6.518057285180573,
+ "eval_entropy": 0.2863075934177221,
+ "eval_loss": 0.7539381384849548,
+ "eval_mean_token_accuracy": 0.8507507083027862,
+ "eval_num_tokens": 6118148.0,
+ "eval_runtime": 86.112,
+ "eval_samples_per_second": 15.968,
+ "eval_steps_per_second": 1.997,
+ "step": 2620
+ },
+ {
+ "entropy": 0.16197575423866512,
+ "epoch": 6.567870485678705,
+ "grad_norm": 0.534295380115509,
+ "learning_rate": 7.205348218055678e-05,
+ "loss": 0.0961170256137848,
+ "mean_token_accuracy": 0.9674530044198036,
+ "num_tokens": 6165523.0,
+ "step": 2640
+ },
+ {
+ "epoch": 6.567870485678705,
+ "eval_entropy": 0.29021967315050057,
+ "eval_loss": 0.751198947429657,
+ "eval_mean_token_accuracy": 0.8509796344956686,
+ "eval_num_tokens": 6165523.0,
+ "eval_runtime": 85.7958,
+ "eval_samples_per_second": 16.026,
+ "eval_steps_per_second": 2.005,
+ "step": 2640
+ },
+ {
+ "entropy": 0.15261746793985367,
+ "epoch": 6.617683686176837,
+ "grad_norm": 0.5391237139701843,
+ "learning_rate": 7.022906815301673e-05,
+ "loss": 0.0926026999950409,
+ "mean_token_accuracy": 0.9695659473538398,
+ "num_tokens": 6216232.0,
+ "step": 2660
+ },
+ {
+ "epoch": 6.617683686176837,
+ "eval_entropy": 0.29128045216202736,
+ "eval_loss": 0.7450292110443115,
+ "eval_mean_token_accuracy": 0.8498771443616512,
+ "eval_num_tokens": 6216232.0,
+ "eval_runtime": 86.3963,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 2660
+ },
+ {
+ "entropy": 0.16164180357009172,
+ "epoch": 6.667496886674969,
+ "grad_norm": 0.5767946243286133,
+ "learning_rate": 6.841759539535419e-05,
+ "loss": 0.09291981458663941,
+ "mean_token_accuracy": 0.9687136687338352,
+ "num_tokens": 6264807.0,
+ "step": 2680
+ },
+ {
+ "epoch": 6.667496886674969,
+ "eval_entropy": 0.2897637223088464,
+ "eval_loss": 0.7503410577774048,
+ "eval_mean_token_accuracy": 0.8503315164599308,
+ "eval_num_tokens": 6264807.0,
+ "eval_runtime": 86.0653,
+ "eval_samples_per_second": 15.976,
+ "eval_steps_per_second": 1.998,
+ "step": 2680
+ },
+ {
+ "entropy": 0.17062523355707526,
+ "epoch": 6.717310087173101,
+ "grad_norm": 0.4974168539047241,
+ "learning_rate": 6.661961022304563e-05,
+ "loss": 0.09713236689567566,
+ "mean_token_accuracy": 0.9661971725523472,
+ "num_tokens": 6308819.0,
+ "step": 2700
+ },
+ {
+ "epoch": 6.717310087173101,
+ "eval_entropy": 0.2765843396963075,
+ "eval_loss": 0.7604002356529236,
+ "eval_mean_token_accuracy": 0.8521115277395692,
+ "eval_num_tokens": 6308819.0,
+ "eval_runtime": 86.1676,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 2700
+ },
+ {
+ "entropy": 0.17544092936441302,
+ "epoch": 6.767123287671232,
+ "grad_norm": 0.5523537993431091,
+ "learning_rate": 6.483565488389582e-05,
+ "loss": 0.09709116220474243,
+ "mean_token_accuracy": 0.9650957375764847,
+ "num_tokens": 6352548.0,
+ "step": 2720
+ },
+ {
+ "epoch": 6.767123287671232,
+ "eval_entropy": 0.27939334659035814,
+ "eval_loss": 0.7534670829772949,
+ "eval_mean_token_accuracy": 0.851230604010959,
+ "eval_num_tokens": 6352548.0,
+ "eval_runtime": 86.2913,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 2720
+ },
+ {
+ "entropy": 0.15991022661328316,
+ "epoch": 6.816936488169365,
+ "grad_norm": 0.478551983833313,
+ "learning_rate": 6.306626739450311e-05,
+ "loss": 0.09564646482467651,
+ "mean_token_accuracy": 0.9679084822535515,
+ "num_tokens": 6397720.0,
+ "step": 2740
+ },
+ {
+ "epoch": 6.816936488169365,
+ "eval_entropy": 0.27878295491601146,
+ "eval_loss": 0.7519959211349487,
+ "eval_mean_token_accuracy": 0.8510654949864676,
+ "eval_num_tokens": 6397720.0,
+ "eval_runtime": 85.9109,
+ "eval_samples_per_second": 16.005,
+ "eval_steps_per_second": 2.002,
+ "step": 2740
+ },
+ {
+ "entropy": 0.16824879590421915,
+ "epoch": 6.866749688667497,
+ "grad_norm": 0.6681098937988281,
+ "learning_rate": 6.131198137800108e-05,
+ "loss": 0.0962279736995697,
+ "mean_token_accuracy": 0.966830012947321,
+ "num_tokens": 6442821.0,
+ "step": 2760
+ },
+ {
+ "epoch": 6.866749688667497,
+ "eval_entropy": 0.2834690434121808,
+ "eval_loss": 0.751922070980072,
+ "eval_mean_token_accuracy": 0.8521237577809844,
+ "eval_num_tokens": 6442821.0,
+ "eval_runtime": 86.3618,
+ "eval_samples_per_second": 15.921,
+ "eval_steps_per_second": 1.992,
+ "step": 2760
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.7169352449845043e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2780/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2780/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2780/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2780/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2780/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2780/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2780/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2780/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2780/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2780/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2780/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2780/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2780/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2780/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..10dbb5c8ee68985bff97a4b529de95480b7efebb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2780/trainer_state.json
@@ -0,0 +1,2953 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 6.916562889165629,
+ "eval_steps": 20,
+ "global_step": 2780,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ },
+ {
+ "entropy": 0.3193941755220294,
+ "epoch": 4.5280199252802,
+ "grad_norm": 0.8281906843185425,
+ "learning_rate": 0.0001509111761786888,
+ "loss": 0.23936262130737304,
+ "mean_token_accuracy": 0.9201708927750587,
+ "num_tokens": 4244423.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.5280199252802,
+ "eval_entropy": 0.38704028864239537,
+ "eval_loss": 0.6006569266319275,
+ "eval_mean_token_accuracy": 0.8502406720505205,
+ "eval_num_tokens": 4244423.0,
+ "eval_runtime": 86.8059,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1820
+ },
+ {
+ "entropy": 0.3164879363030195,
+ "epoch": 4.577833125778331,
+ "grad_norm": 0.7892968654632568,
+ "learning_rate": 0.00014905346557909867,
+ "loss": 0.24541733264923096,
+ "mean_token_accuracy": 0.9175932116806507,
+ "num_tokens": 4289773.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.577833125778331,
+ "eval_entropy": 0.38861122120951497,
+ "eval_loss": 0.6115967631340027,
+ "eval_mean_token_accuracy": 0.849471275196519,
+ "eval_num_tokens": 4289773.0,
+ "eval_runtime": 86.2946,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1840
+ },
+ {
+ "entropy": 0.3051785985007882,
+ "epoch": 4.627646326276463,
+ "grad_norm": 0.8109654188156128,
+ "learning_rate": 0.0001471849238862319,
+ "loss": 0.23433220386505127,
+ "mean_token_accuracy": 0.9206570319831371,
+ "num_tokens": 4336894.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.627646326276463,
+ "eval_entropy": 0.37162452295076015,
+ "eval_loss": 0.6184061765670776,
+ "eval_mean_token_accuracy": 0.8501173268223918,
+ "eval_num_tokens": 4336894.0,
+ "eval_runtime": 86.6865,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1860
+ },
+ {
+ "entropy": 0.3168198253959417,
+ "epoch": 4.677459526774595,
+ "grad_norm": 0.9512342214584351,
+ "learning_rate": 0.0001453061146267775,
+ "loss": 0.23832404613494873,
+ "mean_token_accuracy": 0.9197044663131237,
+ "num_tokens": 4382947.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.677459526774595,
+ "eval_entropy": 0.3845940856912801,
+ "eval_loss": 0.606762707233429,
+ "eval_mean_token_accuracy": 0.8504838194957999,
+ "eval_num_tokens": 4382947.0,
+ "eval_runtime": 86.5175,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 1880
+ },
+ {
+ "entropy": 0.30791807882487776,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 0.8123113512992859,
+ "learning_rate": 0.00014341760442398248,
+ "loss": 0.2395785331726074,
+ "mean_token_accuracy": 0.918928150832653,
+ "num_tokens": 4433050.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.7272727272727275,
+ "eval_entropy": 0.39762327222283494,
+ "eval_loss": 0.5994202494621277,
+ "eval_mean_token_accuracy": 0.8509274201337681,
+ "eval_num_tokens": 4433050.0,
+ "eval_runtime": 86.2873,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.993,
+ "step": 1900
+ },
+ {
+ "entropy": 0.3021434534341097,
+ "epoch": 4.777085927770859,
+ "grad_norm": 0.731787383556366,
+ "learning_rate": 0.000141519962826766,
+ "loss": 0.23494718074798585,
+ "mean_token_accuracy": 0.9201403826475143,
+ "num_tokens": 4483598.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.777085927770859,
+ "eval_entropy": 0.3827026732439219,
+ "eval_loss": 0.5995895862579346,
+ "eval_mean_token_accuracy": 0.851468373523202,
+ "eval_num_tokens": 4483598.0,
+ "eval_runtime": 86.3006,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 1920
+ },
+ {
+ "entropy": 0.31626159623265265,
+ "epoch": 4.826899128268991,
+ "grad_norm": 0.8848487138748169,
+ "learning_rate": 0.00013961376213795132,
+ "loss": 0.2439030647277832,
+ "mean_token_accuracy": 0.9196575872600079,
+ "num_tokens": 4529201.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.826899128268991,
+ "eval_entropy": 0.388698436839636,
+ "eval_loss": 0.6000174283981323,
+ "eval_mean_token_accuracy": 0.8518068187458571,
+ "eval_num_tokens": 4529201.0,
+ "eval_runtime": 86.8979,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.979,
+ "step": 1940
+ },
+ {
+ "entropy": 0.30520407035946845,
+ "epoch": 4.876712328767123,
+ "grad_norm": 0.8532460927963257,
+ "learning_rate": 0.00013769957724166695,
+ "loss": 0.23458616733551024,
+ "mean_token_accuracy": 0.9221912942826748,
+ "num_tokens": 4578167.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.876712328767123,
+ "eval_entropy": 0.38777847102908203,
+ "eval_loss": 0.6004981398582458,
+ "eval_mean_token_accuracy": 0.8516481768253238,
+ "eval_num_tokens": 4578167.0,
+ "eval_runtime": 87.0777,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.975,
+ "step": 1960
+ },
+ {
+ "entropy": 0.3226448342204094,
+ "epoch": 4.926525529265255,
+ "grad_norm": 0.6945561766624451,
+ "learning_rate": 0.0001357779854299694,
+ "loss": 0.24048397541046143,
+ "mean_token_accuracy": 0.9195300146937371,
+ "num_tokens": 4622316.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.926525529265255,
+ "eval_entropy": 0.38581624263247777,
+ "eval_loss": 0.6029234528541565,
+ "eval_mean_token_accuracy": 0.8514213260523108,
+ "eval_num_tokens": 4622316.0,
+ "eval_runtime": 85.8729,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 1980
+ },
+ {
+ "entropy": 0.3051655298098922,
+ "epoch": 4.976338729763388,
+ "grad_norm": 0.7976452708244324,
+ "learning_rate": 0.00013384956622874001,
+ "loss": 0.23584742546081544,
+ "mean_token_accuracy": 0.9216851457953453,
+ "num_tokens": 4670746.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.976338729763388,
+ "eval_entropy": 0.37913159246361533,
+ "eval_loss": 0.6057604551315308,
+ "eval_mean_token_accuracy": 0.8525801203971686,
+ "eval_num_tokens": 4670746.0,
+ "eval_runtime": 86.1145,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2000
+ },
+ {
+ "entropy": 0.27438195240803254,
+ "epoch": 5.024906600249066,
+ "grad_norm": 0.6729586124420166,
+ "learning_rate": 0.0001319149012229075,
+ "loss": 0.19775952100753785,
+ "mean_token_accuracy": 0.9339428559327737,
+ "num_tokens": 4716176.0,
+ "step": 2020
+ },
+ {
+ "epoch": 5.024906600249066,
+ "eval_entropy": 0.3448961910813354,
+ "eval_loss": 0.6750120520591736,
+ "eval_mean_token_accuracy": 0.8487970232963562,
+ "eval_num_tokens": 4716176.0,
+ "eval_runtime": 86.1169,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2020
+ },
+ {
+ "entropy": 0.21423916313797237,
+ "epoch": 5.074719800747198,
+ "grad_norm": 0.6934391856193542,
+ "learning_rate": 0.00012997457388105022,
+ "loss": 0.1439570426940918,
+ "mean_token_accuracy": 0.9528236843645572,
+ "num_tokens": 4763269.0,
+ "step": 2040
+ },
+ {
+ "epoch": 5.074719800747198,
+ "eval_entropy": 0.3570949243771475,
+ "eval_loss": 0.6465504169464111,
+ "eval_mean_token_accuracy": 0.8490785547467166,
+ "eval_num_tokens": 4763269.0,
+ "eval_runtime": 85.9574,
+ "eval_samples_per_second": 15.996,
+ "eval_steps_per_second": 2.001,
+ "step": 2040
+ },
+ {
+ "entropy": 0.20838565267622472,
+ "epoch": 5.12453300124533,
+ "grad_norm": 0.7286986112594604,
+ "learning_rate": 0.00012802916937942972,
+ "loss": 0.14467307329177856,
+ "mean_token_accuracy": 0.950994835793972,
+ "num_tokens": 4809047.0,
+ "step": 2060
+ },
+ {
+ "epoch": 5.12453300124533,
+ "eval_entropy": 0.3452463157821533,
+ "eval_loss": 0.6705958843231201,
+ "eval_mean_token_accuracy": 0.8490352796953778,
+ "eval_num_tokens": 4809047.0,
+ "eval_runtime": 86.228,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 2060
+ },
+ {
+ "entropy": 0.20453082229942082,
+ "epoch": 5.174346201743462,
+ "grad_norm": 0.7515555620193481,
+ "learning_rate": 0.00012607927442550974,
+ "loss": 0.13732000589370727,
+ "mean_token_accuracy": 0.9537357829511166,
+ "num_tokens": 4857965.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.174346201743462,
+ "eval_entropy": 0.32431264914745506,
+ "eval_loss": 0.6743043065071106,
+ "eval_mean_token_accuracy": 0.8504878629085629,
+ "eval_num_tokens": 4857965.0,
+ "eval_runtime": 86.5948,
+ "eval_samples_per_second": 15.879,
+ "eval_steps_per_second": 1.986,
+ "step": 2080
+ },
+ {
+ "entropy": 0.21812320686876774,
+ "epoch": 5.224159402241594,
+ "grad_norm": 0.9093465209007263,
+ "learning_rate": 0.0001241254770810132,
+ "loss": 0.14311420917510986,
+ "mean_token_accuracy": 0.9514068141579628,
+ "num_tokens": 4905151.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.224159402241594,
+ "eval_entropy": 0.33086285835435225,
+ "eval_loss": 0.6676449179649353,
+ "eval_mean_token_accuracy": 0.8505287662495015,
+ "eval_num_tokens": 4905151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 2100
+ },
+ {
+ "entropy": 0.2180163251236081,
+ "epoch": 5.273972602739726,
+ "grad_norm": 0.6703007221221924,
+ "learning_rate": 0.00012216836658457075,
+ "loss": 0.14803968667984008,
+ "mean_token_accuracy": 0.9521303348243236,
+ "num_tokens": 4947072.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.273972602739726,
+ "eval_entropy": 0.33162341708707255,
+ "eval_loss": 0.6658875942230225,
+ "eval_mean_token_accuracy": 0.8500757605530495,
+ "eval_num_tokens": 4947072.0,
+ "eval_runtime": 86.6296,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 2120
+ },
+ {
+ "entropy": 0.22511130161583423,
+ "epoch": 5.323785803237858,
+ "grad_norm": 0.8078880906105042,
+ "learning_rate": 0.00012020853317401455,
+ "loss": 0.15228408575057983,
+ "mean_token_accuracy": 0.947144789993763,
+ "num_tokens": 4991974.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.323785803237858,
+ "eval_entropy": 0.3354601170434508,
+ "eval_loss": 0.6677829623222351,
+ "eval_mean_token_accuracy": 0.8482600024273229,
+ "eval_num_tokens": 4991974.0,
+ "eval_runtime": 86.4689,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.989,
+ "step": 2140
+ },
+ {
+ "entropy": 0.2244176059961319,
+ "epoch": 5.37359900373599,
+ "grad_norm": 0.9636075496673584,
+ "learning_rate": 0.00011824656790837037,
+ "loss": 0.15260883569717407,
+ "mean_token_accuracy": 0.9471467643976211,
+ "num_tokens": 5038400.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.37359900373599,
+ "eval_entropy": 0.3381616926297199,
+ "eval_loss": 0.6694412231445312,
+ "eval_mean_token_accuracy": 0.8482369603805764,
+ "eval_num_tokens": 5038400.0,
+ "eval_runtime": 86.4147,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 2160
+ },
+ {
+ "entropy": 0.22982364390045404,
+ "epoch": 5.423412204234122,
+ "grad_norm": 0.775401771068573,
+ "learning_rate": 0.00011628306248960262,
+ "loss": 0.15140302181243898,
+ "mean_token_accuracy": 0.9492553934454918,
+ "num_tokens": 5083166.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.423412204234122,
+ "eval_entropy": 0.3305150235808173,
+ "eval_loss": 0.6717822551727295,
+ "eval_mean_token_accuracy": 0.8489849723355715,
+ "eval_num_tokens": 5083166.0,
+ "eval_runtime": 86.4728,
+ "eval_samples_per_second": 15.901,
+ "eval_steps_per_second": 1.989,
+ "step": 2180
+ },
+ {
+ "entropy": 0.21448935717344284,
+ "epoch": 5.473225404732254,
+ "grad_norm": 0.6575281023979187,
+ "learning_rate": 0.00011431860908416465,
+ "loss": 0.1452319622039795,
+ "mean_token_accuracy": 0.9505287684500218,
+ "num_tokens": 5135109.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.473225404732254,
+ "eval_entropy": 0.3488145174328671,
+ "eval_loss": 0.6612305641174316,
+ "eval_mean_token_accuracy": 0.8492907808963642,
+ "eval_num_tokens": 5135109.0,
+ "eval_runtime": 86.6927,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 2200
+ },
+ {
+ "entropy": 0.23091202937066554,
+ "epoch": 5.523038605230386,
+ "grad_norm": 0.8909686207771301,
+ "learning_rate": 0.00011235380014440985,
+ "loss": 0.15150139331817628,
+ "mean_token_accuracy": 0.9497875183820724,
+ "num_tokens": 5180138.0,
+ "step": 2220
+ },
+ {
+ "epoch": 5.523038605230386,
+ "eval_entropy": 0.3268539015810157,
+ "eval_loss": 0.6667542457580566,
+ "eval_mean_token_accuracy": 0.8499062903398691,
+ "eval_num_tokens": 5180138.0,
+ "eval_runtime": 86.4644,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 2220
+ },
+ {
+ "entropy": 0.2227974807843566,
+ "epoch": 5.572851805728518,
+ "grad_norm": 0.6180275082588196,
+ "learning_rate": 0.0001103892282299158,
+ "loss": 0.1491069197654724,
+ "mean_token_accuracy": 0.9488144010305405,
+ "num_tokens": 5226864.0,
+ "step": 2240
+ },
+ {
+ "epoch": 5.572851805728518,
+ "eval_entropy": 0.3346347655494546,
+ "eval_loss": 0.6665948629379272,
+ "eval_mean_token_accuracy": 0.8499961893918903,
+ "eval_num_tokens": 5226864.0,
+ "eval_runtime": 87.0548,
+ "eval_samples_per_second": 15.795,
+ "eval_steps_per_second": 1.976,
+ "step": 2240
+ },
+ {
+ "entropy": 0.21368421968072654,
+ "epoch": 5.62266500622665,
+ "grad_norm": 0.6004369258880615,
+ "learning_rate": 0.00010842548582877651,
+ "loss": 0.14485255479812623,
+ "mean_token_accuracy": 0.9502056457102299,
+ "num_tokens": 5276602.0,
+ "step": 2260
+ },
+ {
+ "epoch": 5.62266500622665,
+ "eval_entropy": 0.32753298804163933,
+ "eval_loss": 0.6680151224136353,
+ "eval_mean_token_accuracy": 0.8515451086121936,
+ "eval_num_tokens": 5276602.0,
+ "eval_runtime": 86.8524,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.98,
+ "step": 2260
+ },
+ {
+ "entropy": 0.2103635374456644,
+ "epoch": 5.672478206724782,
+ "grad_norm": 0.699174702167511,
+ "learning_rate": 0.00010646316517891613,
+ "loss": 0.14297772645950318,
+ "mean_token_accuracy": 0.9512537539005279,
+ "num_tokens": 5323718.0,
+ "step": 2280
+ },
+ {
+ "epoch": 5.672478206724782,
+ "eval_entropy": 0.32966585959806,
+ "eval_loss": 0.675578773021698,
+ "eval_mean_token_accuracy": 0.8509623023659684,
+ "eval_num_tokens": 5323718.0,
+ "eval_runtime": 86.4518,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2280
+ },
+ {
+ "entropy": 0.22516900151968003,
+ "epoch": 5.722291407222914,
+ "grad_norm": 0.6637354493141174,
+ "learning_rate": 0.00010450285808947797,
+ "loss": 0.15202572345733642,
+ "mean_token_accuracy": 0.9482452072203159,
+ "num_tokens": 5369039.0,
+ "step": 2300
+ },
+ {
+ "epoch": 5.722291407222914,
+ "eval_entropy": 0.3369456917740578,
+ "eval_loss": 0.6697061061859131,
+ "eval_mean_token_accuracy": 0.848603522361711,
+ "eval_num_tokens": 5369039.0,
+ "eval_runtime": 86.6371,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.985,
+ "step": 2300
+ },
+ {
+ "entropy": 0.21841065725311637,
+ "epoch": 5.772104607721046,
+ "grad_norm": 0.7940268516540527,
+ "learning_rate": 0.00010254515576234297,
+ "loss": 0.14710167646408082,
+ "mean_token_accuracy": 0.9493498183786869,
+ "num_tokens": 5417029.0,
+ "step": 2320
+ },
+ {
+ "epoch": 5.772104607721046,
+ "eval_entropy": 0.3237486180177955,
+ "eval_loss": 0.6779657602310181,
+ "eval_mean_token_accuracy": 0.8500715313955794,
+ "eval_num_tokens": 5417029.0,
+ "eval_runtime": 86.1826,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 1.996,
+ "step": 2320
+ },
+ {
+ "entropy": 0.22146204356104135,
+ "epoch": 5.821917808219178,
+ "grad_norm": 0.9234833121299744,
+ "learning_rate": 0.00010059064861383132,
+ "loss": 0.14720046520233154,
+ "mean_token_accuracy": 0.9493872679769992,
+ "num_tokens": 5461671.0,
+ "step": 2340
+ },
+ {
+ "epoch": 5.821917808219178,
+ "eval_entropy": 0.32365207564692167,
+ "eval_loss": 0.6704005002975464,
+ "eval_mean_token_accuracy": 0.8507985760306203,
+ "eval_num_tokens": 5461671.0,
+ "eval_runtime": 86.5494,
+ "eval_samples_per_second": 15.887,
+ "eval_steps_per_second": 1.987,
+ "step": 2340
+ },
+ {
+ "entropy": 0.20934011954814197,
+ "epoch": 5.87173100871731,
+ "grad_norm": 0.5547503232955933,
+ "learning_rate": 9.863992609664084e-05,
+ "loss": 0.1464867353439331,
+ "mean_token_accuracy": 0.9503875687718392,
+ "num_tokens": 5509312.0,
+ "step": 2360
+ },
+ {
+ "epoch": 5.87173100871731,
+ "eval_entropy": 0.3330401429083458,
+ "eval_loss": 0.6659091114997864,
+ "eval_mean_token_accuracy": 0.8504848906467127,
+ "eval_num_tokens": 5509312.0,
+ "eval_runtime": 86.5855,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 2360
+ },
+ {
+ "entropy": 0.21678635366261007,
+ "epoch": 5.921544209215442,
+ "grad_norm": 0.570612907409668,
+ "learning_rate": 9.669357652207635e-05,
+ "loss": 0.14821385145187377,
+ "mean_token_accuracy": 0.9503940217196941,
+ "num_tokens": 5558196.0,
+ "step": 2380
+ },
+ {
+ "epoch": 5.921544209215442,
+ "eval_entropy": 0.3322022325077722,
+ "eval_loss": 0.6722489595413208,
+ "eval_mean_token_accuracy": 0.8489979422369669,
+ "eval_num_tokens": 5558196.0,
+ "eval_runtime": 86.2986,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 2380
+ },
+ {
+ "entropy": 0.20932920072227718,
+ "epoch": 5.971357409713574,
+ "grad_norm": 0.7879557609558105,
+ "learning_rate": 9.475218688262262e-05,
+ "loss": 0.14675841331481934,
+ "mean_token_accuracy": 0.9507176131010056,
+ "num_tokens": 5605400.0,
+ "step": 2400
+ },
+ {
+ "epoch": 5.971357409713574,
+ "eval_entropy": 0.3199348642902319,
+ "eval_loss": 0.6698136329650879,
+ "eval_mean_token_accuracy": 0.8514142130003419,
+ "eval_num_tokens": 5605400.0,
+ "eval_runtime": 85.8995,
+ "eval_samples_per_second": 16.007,
+ "eval_steps_per_second": 2.002,
+ "step": 2400
+ },
+ {
+ "entropy": 0.21032143919131693,
+ "epoch": 6.019925280199253,
+ "grad_norm": 0.5823076367378235,
+ "learning_rate": 9.281634267491569e-05,
+ "loss": 0.13322267532348633,
+ "mean_token_accuracy": 0.9550939072401096,
+ "num_tokens": 5648968.0,
+ "step": 2420
+ },
+ {
+ "epoch": 6.019925280199253,
+ "eval_entropy": 0.30206270117399303,
+ "eval_loss": 0.7093168497085571,
+ "eval_mean_token_accuracy": 0.8500627639681794,
+ "eval_num_tokens": 5648968.0,
+ "eval_runtime": 85.8128,
+ "eval_samples_per_second": 16.023,
+ "eval_steps_per_second": 2.004,
+ "step": 2420
+ },
+ {
+ "entropy": 0.1534628233872354,
+ "epoch": 6.069738480697385,
+ "grad_norm": 0.710133969783783,
+ "learning_rate": 9.088662772316508e-05,
+ "loss": 0.09078952670097351,
+ "mean_token_accuracy": 0.9678447999060154,
+ "num_tokens": 5697633.0,
+ "step": 2440
+ },
+ {
+ "epoch": 6.069738480697385,
+ "eval_entropy": 0.28208133101809857,
+ "eval_loss": 0.7636417150497437,
+ "eval_mean_token_accuracy": 0.8494061477655588,
+ "eval_num_tokens": 5697633.0,
+ "eval_runtime": 85.9724,
+ "eval_samples_per_second": 15.994,
+ "eval_steps_per_second": 2.001,
+ "step": 2440
+ },
+ {
+ "entropy": 0.16151462448760867,
+ "epoch": 6.119551681195516,
+ "grad_norm": 0.5793812274932861,
+ "learning_rate": 8.896362400308028e-05,
+ "loss": 0.09545697569847107,
+ "mean_token_accuracy": 0.9671573750674725,
+ "num_tokens": 5745090.0,
+ "step": 2460
+ },
+ {
+ "epoch": 6.119551681195516,
+ "eval_entropy": 0.2833245605403601,
+ "eval_loss": 0.7402405738830566,
+ "eval_mean_token_accuracy": 0.8503523728875226,
+ "eval_num_tokens": 5745090.0,
+ "eval_runtime": 85.5461,
+ "eval_samples_per_second": 16.073,
+ "eval_steps_per_second": 2.011,
+ "step": 2460
+ },
+ {
+ "entropy": 0.15203177919611335,
+ "epoch": 6.169364881693649,
+ "grad_norm": 0.4251123368740082,
+ "learning_rate": 8.704791146635483e-05,
+ "loss": 0.09420782327651978,
+ "mean_token_accuracy": 0.9677386932075024,
+ "num_tokens": 5790333.0,
+ "step": 2480
+ },
+ {
+ "epoch": 6.169364881693649,
+ "eval_entropy": 0.28572545962971313,
+ "eval_loss": 0.735416829586029,
+ "eval_mean_token_accuracy": 0.8487084663884584,
+ "eval_num_tokens": 5790333.0,
+ "eval_runtime": 85.4801,
+ "eval_samples_per_second": 16.086,
+ "eval_steps_per_second": 2.012,
+ "step": 2480
+ },
+ {
+ "entropy": 0.15587336672469973,
+ "epoch": 6.219178082191781,
+ "grad_norm": 0.4357028007507324,
+ "learning_rate": 8.514006786576085e-05,
+ "loss": 0.09429320096969604,
+ "mean_token_accuracy": 0.9682952925562859,
+ "num_tokens": 5837321.0,
+ "step": 2500
+ },
+ {
+ "epoch": 6.219178082191781,
+ "eval_entropy": 0.2859006894882335,
+ "eval_loss": 0.7347224950790405,
+ "eval_mean_token_accuracy": 0.8501905518215757,
+ "eval_num_tokens": 5837321.0,
+ "eval_runtime": 85.7578,
+ "eval_samples_per_second": 16.034,
+ "eval_steps_per_second": 2.006,
+ "step": 2500
+ },
+ {
+ "entropy": 0.15765639198943973,
+ "epoch": 6.268991282689913,
+ "grad_norm": 0.47331130504608154,
+ "learning_rate": 8.324066858090663e-05,
+ "loss": 0.09571113586425781,
+ "mean_token_accuracy": 0.9683481335639954,
+ "num_tokens": 5884398.0,
+ "step": 2520
+ },
+ {
+ "epoch": 6.268991282689913,
+ "eval_entropy": 0.29231513846059176,
+ "eval_loss": 0.7392512559890747,
+ "eval_mean_token_accuracy": 0.8486633983462356,
+ "eval_num_tokens": 5884398.0,
+ "eval_runtime": 85.7846,
+ "eval_samples_per_second": 16.029,
+ "eval_steps_per_second": 2.005,
+ "step": 2520
+ },
+ {
+ "entropy": 0.16176860257983208,
+ "epoch": 6.318804483188045,
+ "grad_norm": 0.6142018437385559,
+ "learning_rate": 8.135028644470992e-05,
+ "loss": 0.09486144185066223,
+ "mean_token_accuracy": 0.9682316601276397,
+ "num_tokens": 5929876.0,
+ "step": 2540
+ },
+ {
+ "epoch": 6.318804483188045,
+ "eval_entropy": 0.2851274753379267,
+ "eval_loss": 0.7520816922187805,
+ "eval_mean_token_accuracy": 0.8501113649717597,
+ "eval_num_tokens": 5929876.0,
+ "eval_runtime": 85.9425,
+ "eval_samples_per_second": 15.999,
+ "eval_steps_per_second": 2.001,
+ "step": 2540
+ },
+ {
+ "entropy": 0.15404034564271568,
+ "epoch": 6.3686176836861765,
+ "grad_norm": 0.6051287651062012,
+ "learning_rate": 7.946949157063964e-05,
+ "loss": 0.09280472993850708,
+ "mean_token_accuracy": 0.9684635892510414,
+ "num_tokens": 5978490.0,
+ "step": 2560
+ },
+ {
+ "epoch": 6.3686176836861765,
+ "eval_entropy": 0.28802703563557114,
+ "eval_loss": 0.7439162135124207,
+ "eval_mean_token_accuracy": 0.8499851770872293,
+ "eval_num_tokens": 5978490.0,
+ "eval_runtime": 86.0703,
+ "eval_samples_per_second": 15.975,
+ "eval_steps_per_second": 1.998,
+ "step": 2560
+ },
+ {
+ "entropy": 0.15343588953837753,
+ "epoch": 6.418430884184309,
+ "grad_norm": 0.4823743402957916,
+ "learning_rate": 7.759885118077701e-05,
+ "loss": 0.09000591039657593,
+ "mean_token_accuracy": 0.9699928767979145,
+ "num_tokens": 6025380.0,
+ "step": 2580
+ },
+ {
+ "epoch": 6.418430884184309,
+ "eval_entropy": 0.2795634938533916,
+ "eval_loss": 0.7647850513458252,
+ "eval_mean_token_accuracy": 0.8503464397995971,
+ "eval_num_tokens": 6025380.0,
+ "eval_runtime": 85.8886,
+ "eval_samples_per_second": 16.009,
+ "eval_steps_per_second": 2.003,
+ "step": 2580
+ },
+ {
+ "entropy": 0.15740026142448188,
+ "epoch": 6.468244084682441,
+ "grad_norm": 0.5082696676254272,
+ "learning_rate": 7.57389294347494e-05,
+ "loss": 0.09191849827766418,
+ "mean_token_accuracy": 0.9692809768021107,
+ "num_tokens": 6073349.0,
+ "step": 2600
+ },
+ {
+ "epoch": 6.468244084682441,
+ "eval_entropy": 0.2913342311458532,
+ "eval_loss": 0.7518694996833801,
+ "eval_mean_token_accuracy": 0.8483168302580367,
+ "eval_num_tokens": 6073349.0,
+ "eval_runtime": 85.5761,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.01,
+ "step": 2600
+ },
+ {
+ "entropy": 0.15922069251537324,
+ "epoch": 6.518057285180573,
+ "grad_norm": 0.3995199501514435,
+ "learning_rate": 7.389028725958736e-05,
+ "loss": 0.09584367871284485,
+ "mean_token_accuracy": 0.9685114495456218,
+ "num_tokens": 6118148.0,
+ "step": 2620
+ },
+ {
+ "epoch": 6.518057285180573,
+ "eval_entropy": 0.2863075934177221,
+ "eval_loss": 0.7539381384849548,
+ "eval_mean_token_accuracy": 0.8507507083027862,
+ "eval_num_tokens": 6118148.0,
+ "eval_runtime": 86.112,
+ "eval_samples_per_second": 15.968,
+ "eval_steps_per_second": 1.997,
+ "step": 2620
+ },
+ {
+ "entropy": 0.16197575423866512,
+ "epoch": 6.567870485678705,
+ "grad_norm": 0.534295380115509,
+ "learning_rate": 7.205348218055678e-05,
+ "loss": 0.0961170256137848,
+ "mean_token_accuracy": 0.9674530044198036,
+ "num_tokens": 6165523.0,
+ "step": 2640
+ },
+ {
+ "epoch": 6.567870485678705,
+ "eval_entropy": 0.29021967315050057,
+ "eval_loss": 0.751198947429657,
+ "eval_mean_token_accuracy": 0.8509796344956686,
+ "eval_num_tokens": 6165523.0,
+ "eval_runtime": 85.7958,
+ "eval_samples_per_second": 16.026,
+ "eval_steps_per_second": 2.005,
+ "step": 2640
+ },
+ {
+ "entropy": 0.15261746793985367,
+ "epoch": 6.617683686176837,
+ "grad_norm": 0.5391237139701843,
+ "learning_rate": 7.022906815301673e-05,
+ "loss": 0.0926026999950409,
+ "mean_token_accuracy": 0.9695659473538398,
+ "num_tokens": 6216232.0,
+ "step": 2660
+ },
+ {
+ "epoch": 6.617683686176837,
+ "eval_entropy": 0.29128045216202736,
+ "eval_loss": 0.7450292110443115,
+ "eval_mean_token_accuracy": 0.8498771443616512,
+ "eval_num_tokens": 6216232.0,
+ "eval_runtime": 86.3963,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 2660
+ },
+ {
+ "entropy": 0.16164180357009172,
+ "epoch": 6.667496886674969,
+ "grad_norm": 0.5767946243286133,
+ "learning_rate": 6.841759539535419e-05,
+ "loss": 0.09291981458663941,
+ "mean_token_accuracy": 0.9687136687338352,
+ "num_tokens": 6264807.0,
+ "step": 2680
+ },
+ {
+ "epoch": 6.667496886674969,
+ "eval_entropy": 0.2897637223088464,
+ "eval_loss": 0.7503410577774048,
+ "eval_mean_token_accuracy": 0.8503315164599308,
+ "eval_num_tokens": 6264807.0,
+ "eval_runtime": 86.0653,
+ "eval_samples_per_second": 15.976,
+ "eval_steps_per_second": 1.998,
+ "step": 2680
+ },
+ {
+ "entropy": 0.17062523355707526,
+ "epoch": 6.717310087173101,
+ "grad_norm": 0.4974168539047241,
+ "learning_rate": 6.661961022304563e-05,
+ "loss": 0.09713236689567566,
+ "mean_token_accuracy": 0.9661971725523472,
+ "num_tokens": 6308819.0,
+ "step": 2700
+ },
+ {
+ "epoch": 6.717310087173101,
+ "eval_entropy": 0.2765843396963075,
+ "eval_loss": 0.7604002356529236,
+ "eval_mean_token_accuracy": 0.8521115277395692,
+ "eval_num_tokens": 6308819.0,
+ "eval_runtime": 86.1676,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 2700
+ },
+ {
+ "entropy": 0.17544092936441302,
+ "epoch": 6.767123287671232,
+ "grad_norm": 0.5523537993431091,
+ "learning_rate": 6.483565488389582e-05,
+ "loss": 0.09709116220474243,
+ "mean_token_accuracy": 0.9650957375764847,
+ "num_tokens": 6352548.0,
+ "step": 2720
+ },
+ {
+ "epoch": 6.767123287671232,
+ "eval_entropy": 0.27939334659035814,
+ "eval_loss": 0.7534670829772949,
+ "eval_mean_token_accuracy": 0.851230604010959,
+ "eval_num_tokens": 6352548.0,
+ "eval_runtime": 86.2913,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 2720
+ },
+ {
+ "entropy": 0.15991022661328316,
+ "epoch": 6.816936488169365,
+ "grad_norm": 0.478551983833313,
+ "learning_rate": 6.306626739450311e-05,
+ "loss": 0.09564646482467651,
+ "mean_token_accuracy": 0.9679084822535515,
+ "num_tokens": 6397720.0,
+ "step": 2740
+ },
+ {
+ "epoch": 6.816936488169365,
+ "eval_entropy": 0.27878295491601146,
+ "eval_loss": 0.7519959211349487,
+ "eval_mean_token_accuracy": 0.8510654949864676,
+ "eval_num_tokens": 6397720.0,
+ "eval_runtime": 85.9109,
+ "eval_samples_per_second": 16.005,
+ "eval_steps_per_second": 2.002,
+ "step": 2740
+ },
+ {
+ "entropy": 0.16824879590421915,
+ "epoch": 6.866749688667497,
+ "grad_norm": 0.6681098937988281,
+ "learning_rate": 6.131198137800108e-05,
+ "loss": 0.0962279736995697,
+ "mean_token_accuracy": 0.966830012947321,
+ "num_tokens": 6442821.0,
+ "step": 2760
+ },
+ {
+ "epoch": 6.866749688667497,
+ "eval_entropy": 0.2834690434121808,
+ "eval_loss": 0.751922070980072,
+ "eval_mean_token_accuracy": 0.8521237577809844,
+ "eval_num_tokens": 6442821.0,
+ "eval_runtime": 86.3618,
+ "eval_samples_per_second": 15.921,
+ "eval_steps_per_second": 1.992,
+ "step": 2760
+ },
+ {
+ "entropy": 0.1518704930320382,
+ "epoch": 6.916562889165629,
+ "grad_norm": 0.5201290249824524,
+ "learning_rate": 5.957332590312513e-05,
+ "loss": 0.09010660648345947,
+ "mean_token_accuracy": 0.9693463340401649,
+ "num_tokens": 6494118.0,
+ "step": 2780
+ },
+ {
+ "epoch": 6.916562889165629,
+ "eval_entropy": 0.28485129617674404,
+ "eval_loss": 0.7452457547187805,
+ "eval_mean_token_accuracy": 0.8512036796919135,
+ "eval_num_tokens": 6494118.0,
+ "eval_runtime": 86.4524,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2780
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.7396395598681907e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-280/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-280/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-280/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-280/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-280/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-280/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-280/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-280/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-280/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-280/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-280/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-280/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-280/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-280/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..591e69b397864ceae5fe71e01de2c9f2cac1f269
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-280/trainer_state.json
@@ -0,0 +1,328 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 0.6973848069738481,
+ "eval_steps": 20,
+ "global_step": 280,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.799770988645581e+16,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2800/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2800/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2800/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2800/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2800/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2800/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2800/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2800/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2800/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2800/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2800/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2800/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2800/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2800/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..36a5e102510d2d38e951a8492ea6792d2778b90d
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2800/trainer_state.json
@@ -0,0 +1,2974 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 6.966376089663761,
+ "eval_steps": 20,
+ "global_step": 2800,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ },
+ {
+ "entropy": 0.3193941755220294,
+ "epoch": 4.5280199252802,
+ "grad_norm": 0.8281906843185425,
+ "learning_rate": 0.0001509111761786888,
+ "loss": 0.23936262130737304,
+ "mean_token_accuracy": 0.9201708927750587,
+ "num_tokens": 4244423.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.5280199252802,
+ "eval_entropy": 0.38704028864239537,
+ "eval_loss": 0.6006569266319275,
+ "eval_mean_token_accuracy": 0.8502406720505205,
+ "eval_num_tokens": 4244423.0,
+ "eval_runtime": 86.8059,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1820
+ },
+ {
+ "entropy": 0.3164879363030195,
+ "epoch": 4.577833125778331,
+ "grad_norm": 0.7892968654632568,
+ "learning_rate": 0.00014905346557909867,
+ "loss": 0.24541733264923096,
+ "mean_token_accuracy": 0.9175932116806507,
+ "num_tokens": 4289773.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.577833125778331,
+ "eval_entropy": 0.38861122120951497,
+ "eval_loss": 0.6115967631340027,
+ "eval_mean_token_accuracy": 0.849471275196519,
+ "eval_num_tokens": 4289773.0,
+ "eval_runtime": 86.2946,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1840
+ },
+ {
+ "entropy": 0.3051785985007882,
+ "epoch": 4.627646326276463,
+ "grad_norm": 0.8109654188156128,
+ "learning_rate": 0.0001471849238862319,
+ "loss": 0.23433220386505127,
+ "mean_token_accuracy": 0.9206570319831371,
+ "num_tokens": 4336894.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.627646326276463,
+ "eval_entropy": 0.37162452295076015,
+ "eval_loss": 0.6184061765670776,
+ "eval_mean_token_accuracy": 0.8501173268223918,
+ "eval_num_tokens": 4336894.0,
+ "eval_runtime": 86.6865,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1860
+ },
+ {
+ "entropy": 0.3168198253959417,
+ "epoch": 4.677459526774595,
+ "grad_norm": 0.9512342214584351,
+ "learning_rate": 0.0001453061146267775,
+ "loss": 0.23832404613494873,
+ "mean_token_accuracy": 0.9197044663131237,
+ "num_tokens": 4382947.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.677459526774595,
+ "eval_entropy": 0.3845940856912801,
+ "eval_loss": 0.606762707233429,
+ "eval_mean_token_accuracy": 0.8504838194957999,
+ "eval_num_tokens": 4382947.0,
+ "eval_runtime": 86.5175,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 1880
+ },
+ {
+ "entropy": 0.30791807882487776,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 0.8123113512992859,
+ "learning_rate": 0.00014341760442398248,
+ "loss": 0.2395785331726074,
+ "mean_token_accuracy": 0.918928150832653,
+ "num_tokens": 4433050.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.7272727272727275,
+ "eval_entropy": 0.39762327222283494,
+ "eval_loss": 0.5994202494621277,
+ "eval_mean_token_accuracy": 0.8509274201337681,
+ "eval_num_tokens": 4433050.0,
+ "eval_runtime": 86.2873,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.993,
+ "step": 1900
+ },
+ {
+ "entropy": 0.3021434534341097,
+ "epoch": 4.777085927770859,
+ "grad_norm": 0.731787383556366,
+ "learning_rate": 0.000141519962826766,
+ "loss": 0.23494718074798585,
+ "mean_token_accuracy": 0.9201403826475143,
+ "num_tokens": 4483598.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.777085927770859,
+ "eval_entropy": 0.3827026732439219,
+ "eval_loss": 0.5995895862579346,
+ "eval_mean_token_accuracy": 0.851468373523202,
+ "eval_num_tokens": 4483598.0,
+ "eval_runtime": 86.3006,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 1920
+ },
+ {
+ "entropy": 0.31626159623265265,
+ "epoch": 4.826899128268991,
+ "grad_norm": 0.8848487138748169,
+ "learning_rate": 0.00013961376213795132,
+ "loss": 0.2439030647277832,
+ "mean_token_accuracy": 0.9196575872600079,
+ "num_tokens": 4529201.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.826899128268991,
+ "eval_entropy": 0.388698436839636,
+ "eval_loss": 0.6000174283981323,
+ "eval_mean_token_accuracy": 0.8518068187458571,
+ "eval_num_tokens": 4529201.0,
+ "eval_runtime": 86.8979,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.979,
+ "step": 1940
+ },
+ {
+ "entropy": 0.30520407035946845,
+ "epoch": 4.876712328767123,
+ "grad_norm": 0.8532460927963257,
+ "learning_rate": 0.00013769957724166695,
+ "loss": 0.23458616733551024,
+ "mean_token_accuracy": 0.9221912942826748,
+ "num_tokens": 4578167.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.876712328767123,
+ "eval_entropy": 0.38777847102908203,
+ "eval_loss": 0.6004981398582458,
+ "eval_mean_token_accuracy": 0.8516481768253238,
+ "eval_num_tokens": 4578167.0,
+ "eval_runtime": 87.0777,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.975,
+ "step": 1960
+ },
+ {
+ "entropy": 0.3226448342204094,
+ "epoch": 4.926525529265255,
+ "grad_norm": 0.6945561766624451,
+ "learning_rate": 0.0001357779854299694,
+ "loss": 0.24048397541046143,
+ "mean_token_accuracy": 0.9195300146937371,
+ "num_tokens": 4622316.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.926525529265255,
+ "eval_entropy": 0.38581624263247777,
+ "eval_loss": 0.6029234528541565,
+ "eval_mean_token_accuracy": 0.8514213260523108,
+ "eval_num_tokens": 4622316.0,
+ "eval_runtime": 85.8729,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 1980
+ },
+ {
+ "entropy": 0.3051655298098922,
+ "epoch": 4.976338729763388,
+ "grad_norm": 0.7976452708244324,
+ "learning_rate": 0.00013384956622874001,
+ "loss": 0.23584742546081544,
+ "mean_token_accuracy": 0.9216851457953453,
+ "num_tokens": 4670746.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.976338729763388,
+ "eval_entropy": 0.37913159246361533,
+ "eval_loss": 0.6057604551315308,
+ "eval_mean_token_accuracy": 0.8525801203971686,
+ "eval_num_tokens": 4670746.0,
+ "eval_runtime": 86.1145,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2000
+ },
+ {
+ "entropy": 0.27438195240803254,
+ "epoch": 5.024906600249066,
+ "grad_norm": 0.6729586124420166,
+ "learning_rate": 0.0001319149012229075,
+ "loss": 0.19775952100753785,
+ "mean_token_accuracy": 0.9339428559327737,
+ "num_tokens": 4716176.0,
+ "step": 2020
+ },
+ {
+ "epoch": 5.024906600249066,
+ "eval_entropy": 0.3448961910813354,
+ "eval_loss": 0.6750120520591736,
+ "eval_mean_token_accuracy": 0.8487970232963562,
+ "eval_num_tokens": 4716176.0,
+ "eval_runtime": 86.1169,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2020
+ },
+ {
+ "entropy": 0.21423916313797237,
+ "epoch": 5.074719800747198,
+ "grad_norm": 0.6934391856193542,
+ "learning_rate": 0.00012997457388105022,
+ "loss": 0.1439570426940918,
+ "mean_token_accuracy": 0.9528236843645572,
+ "num_tokens": 4763269.0,
+ "step": 2040
+ },
+ {
+ "epoch": 5.074719800747198,
+ "eval_entropy": 0.3570949243771475,
+ "eval_loss": 0.6465504169464111,
+ "eval_mean_token_accuracy": 0.8490785547467166,
+ "eval_num_tokens": 4763269.0,
+ "eval_runtime": 85.9574,
+ "eval_samples_per_second": 15.996,
+ "eval_steps_per_second": 2.001,
+ "step": 2040
+ },
+ {
+ "entropy": 0.20838565267622472,
+ "epoch": 5.12453300124533,
+ "grad_norm": 0.7286986112594604,
+ "learning_rate": 0.00012802916937942972,
+ "loss": 0.14467307329177856,
+ "mean_token_accuracy": 0.950994835793972,
+ "num_tokens": 4809047.0,
+ "step": 2060
+ },
+ {
+ "epoch": 5.12453300124533,
+ "eval_entropy": 0.3452463157821533,
+ "eval_loss": 0.6705958843231201,
+ "eval_mean_token_accuracy": 0.8490352796953778,
+ "eval_num_tokens": 4809047.0,
+ "eval_runtime": 86.228,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 2060
+ },
+ {
+ "entropy": 0.20453082229942082,
+ "epoch": 5.174346201743462,
+ "grad_norm": 0.7515555620193481,
+ "learning_rate": 0.00012607927442550974,
+ "loss": 0.13732000589370727,
+ "mean_token_accuracy": 0.9537357829511166,
+ "num_tokens": 4857965.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.174346201743462,
+ "eval_entropy": 0.32431264914745506,
+ "eval_loss": 0.6743043065071106,
+ "eval_mean_token_accuracy": 0.8504878629085629,
+ "eval_num_tokens": 4857965.0,
+ "eval_runtime": 86.5948,
+ "eval_samples_per_second": 15.879,
+ "eval_steps_per_second": 1.986,
+ "step": 2080
+ },
+ {
+ "entropy": 0.21812320686876774,
+ "epoch": 5.224159402241594,
+ "grad_norm": 0.9093465209007263,
+ "learning_rate": 0.0001241254770810132,
+ "loss": 0.14311420917510986,
+ "mean_token_accuracy": 0.9514068141579628,
+ "num_tokens": 4905151.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.224159402241594,
+ "eval_entropy": 0.33086285835435225,
+ "eval_loss": 0.6676449179649353,
+ "eval_mean_token_accuracy": 0.8505287662495015,
+ "eval_num_tokens": 4905151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 2100
+ },
+ {
+ "entropy": 0.2180163251236081,
+ "epoch": 5.273972602739726,
+ "grad_norm": 0.6703007221221924,
+ "learning_rate": 0.00012216836658457075,
+ "loss": 0.14803968667984008,
+ "mean_token_accuracy": 0.9521303348243236,
+ "num_tokens": 4947072.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.273972602739726,
+ "eval_entropy": 0.33162341708707255,
+ "eval_loss": 0.6658875942230225,
+ "eval_mean_token_accuracy": 0.8500757605530495,
+ "eval_num_tokens": 4947072.0,
+ "eval_runtime": 86.6296,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 2120
+ },
+ {
+ "entropy": 0.22511130161583423,
+ "epoch": 5.323785803237858,
+ "grad_norm": 0.8078880906105042,
+ "learning_rate": 0.00012020853317401455,
+ "loss": 0.15228408575057983,
+ "mean_token_accuracy": 0.947144789993763,
+ "num_tokens": 4991974.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.323785803237858,
+ "eval_entropy": 0.3354601170434508,
+ "eval_loss": 0.6677829623222351,
+ "eval_mean_token_accuracy": 0.8482600024273229,
+ "eval_num_tokens": 4991974.0,
+ "eval_runtime": 86.4689,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.989,
+ "step": 2140
+ },
+ {
+ "entropy": 0.2244176059961319,
+ "epoch": 5.37359900373599,
+ "grad_norm": 0.9636075496673584,
+ "learning_rate": 0.00011824656790837037,
+ "loss": 0.15260883569717407,
+ "mean_token_accuracy": 0.9471467643976211,
+ "num_tokens": 5038400.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.37359900373599,
+ "eval_entropy": 0.3381616926297199,
+ "eval_loss": 0.6694412231445312,
+ "eval_mean_token_accuracy": 0.8482369603805764,
+ "eval_num_tokens": 5038400.0,
+ "eval_runtime": 86.4147,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 2160
+ },
+ {
+ "entropy": 0.22982364390045404,
+ "epoch": 5.423412204234122,
+ "grad_norm": 0.775401771068573,
+ "learning_rate": 0.00011628306248960262,
+ "loss": 0.15140302181243898,
+ "mean_token_accuracy": 0.9492553934454918,
+ "num_tokens": 5083166.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.423412204234122,
+ "eval_entropy": 0.3305150235808173,
+ "eval_loss": 0.6717822551727295,
+ "eval_mean_token_accuracy": 0.8489849723355715,
+ "eval_num_tokens": 5083166.0,
+ "eval_runtime": 86.4728,
+ "eval_samples_per_second": 15.901,
+ "eval_steps_per_second": 1.989,
+ "step": 2180
+ },
+ {
+ "entropy": 0.21448935717344284,
+ "epoch": 5.473225404732254,
+ "grad_norm": 0.6575281023979187,
+ "learning_rate": 0.00011431860908416465,
+ "loss": 0.1452319622039795,
+ "mean_token_accuracy": 0.9505287684500218,
+ "num_tokens": 5135109.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.473225404732254,
+ "eval_entropy": 0.3488145174328671,
+ "eval_loss": 0.6612305641174316,
+ "eval_mean_token_accuracy": 0.8492907808963642,
+ "eval_num_tokens": 5135109.0,
+ "eval_runtime": 86.6927,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 2200
+ },
+ {
+ "entropy": 0.23091202937066554,
+ "epoch": 5.523038605230386,
+ "grad_norm": 0.8909686207771301,
+ "learning_rate": 0.00011235380014440985,
+ "loss": 0.15150139331817628,
+ "mean_token_accuracy": 0.9497875183820724,
+ "num_tokens": 5180138.0,
+ "step": 2220
+ },
+ {
+ "epoch": 5.523038605230386,
+ "eval_entropy": 0.3268539015810157,
+ "eval_loss": 0.6667542457580566,
+ "eval_mean_token_accuracy": 0.8499062903398691,
+ "eval_num_tokens": 5180138.0,
+ "eval_runtime": 86.4644,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 2220
+ },
+ {
+ "entropy": 0.2227974807843566,
+ "epoch": 5.572851805728518,
+ "grad_norm": 0.6180275082588196,
+ "learning_rate": 0.0001103892282299158,
+ "loss": 0.1491069197654724,
+ "mean_token_accuracy": 0.9488144010305405,
+ "num_tokens": 5226864.0,
+ "step": 2240
+ },
+ {
+ "epoch": 5.572851805728518,
+ "eval_entropy": 0.3346347655494546,
+ "eval_loss": 0.6665948629379272,
+ "eval_mean_token_accuracy": 0.8499961893918903,
+ "eval_num_tokens": 5226864.0,
+ "eval_runtime": 87.0548,
+ "eval_samples_per_second": 15.795,
+ "eval_steps_per_second": 1.976,
+ "step": 2240
+ },
+ {
+ "entropy": 0.21368421968072654,
+ "epoch": 5.62266500622665,
+ "grad_norm": 0.6004369258880615,
+ "learning_rate": 0.00010842548582877651,
+ "loss": 0.14485255479812623,
+ "mean_token_accuracy": 0.9502056457102299,
+ "num_tokens": 5276602.0,
+ "step": 2260
+ },
+ {
+ "epoch": 5.62266500622665,
+ "eval_entropy": 0.32753298804163933,
+ "eval_loss": 0.6680151224136353,
+ "eval_mean_token_accuracy": 0.8515451086121936,
+ "eval_num_tokens": 5276602.0,
+ "eval_runtime": 86.8524,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.98,
+ "step": 2260
+ },
+ {
+ "entropy": 0.2103635374456644,
+ "epoch": 5.672478206724782,
+ "grad_norm": 0.699174702167511,
+ "learning_rate": 0.00010646316517891613,
+ "loss": 0.14297772645950318,
+ "mean_token_accuracy": 0.9512537539005279,
+ "num_tokens": 5323718.0,
+ "step": 2280
+ },
+ {
+ "epoch": 5.672478206724782,
+ "eval_entropy": 0.32966585959806,
+ "eval_loss": 0.675578773021698,
+ "eval_mean_token_accuracy": 0.8509623023659684,
+ "eval_num_tokens": 5323718.0,
+ "eval_runtime": 86.4518,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2280
+ },
+ {
+ "entropy": 0.22516900151968003,
+ "epoch": 5.722291407222914,
+ "grad_norm": 0.6637354493141174,
+ "learning_rate": 0.00010450285808947797,
+ "loss": 0.15202572345733642,
+ "mean_token_accuracy": 0.9482452072203159,
+ "num_tokens": 5369039.0,
+ "step": 2300
+ },
+ {
+ "epoch": 5.722291407222914,
+ "eval_entropy": 0.3369456917740578,
+ "eval_loss": 0.6697061061859131,
+ "eval_mean_token_accuracy": 0.848603522361711,
+ "eval_num_tokens": 5369039.0,
+ "eval_runtime": 86.6371,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.985,
+ "step": 2300
+ },
+ {
+ "entropy": 0.21841065725311637,
+ "epoch": 5.772104607721046,
+ "grad_norm": 0.7940268516540527,
+ "learning_rate": 0.00010254515576234297,
+ "loss": 0.14710167646408082,
+ "mean_token_accuracy": 0.9493498183786869,
+ "num_tokens": 5417029.0,
+ "step": 2320
+ },
+ {
+ "epoch": 5.772104607721046,
+ "eval_entropy": 0.3237486180177955,
+ "eval_loss": 0.6779657602310181,
+ "eval_mean_token_accuracy": 0.8500715313955794,
+ "eval_num_tokens": 5417029.0,
+ "eval_runtime": 86.1826,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 1.996,
+ "step": 2320
+ },
+ {
+ "entropy": 0.22146204356104135,
+ "epoch": 5.821917808219178,
+ "grad_norm": 0.9234833121299744,
+ "learning_rate": 0.00010059064861383132,
+ "loss": 0.14720046520233154,
+ "mean_token_accuracy": 0.9493872679769992,
+ "num_tokens": 5461671.0,
+ "step": 2340
+ },
+ {
+ "epoch": 5.821917808219178,
+ "eval_entropy": 0.32365207564692167,
+ "eval_loss": 0.6704005002975464,
+ "eval_mean_token_accuracy": 0.8507985760306203,
+ "eval_num_tokens": 5461671.0,
+ "eval_runtime": 86.5494,
+ "eval_samples_per_second": 15.887,
+ "eval_steps_per_second": 1.987,
+ "step": 2340
+ },
+ {
+ "entropy": 0.20934011954814197,
+ "epoch": 5.87173100871731,
+ "grad_norm": 0.5547503232955933,
+ "learning_rate": 9.863992609664084e-05,
+ "loss": 0.1464867353439331,
+ "mean_token_accuracy": 0.9503875687718392,
+ "num_tokens": 5509312.0,
+ "step": 2360
+ },
+ {
+ "epoch": 5.87173100871731,
+ "eval_entropy": 0.3330401429083458,
+ "eval_loss": 0.6659091114997864,
+ "eval_mean_token_accuracy": 0.8504848906467127,
+ "eval_num_tokens": 5509312.0,
+ "eval_runtime": 86.5855,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 2360
+ },
+ {
+ "entropy": 0.21678635366261007,
+ "epoch": 5.921544209215442,
+ "grad_norm": 0.570612907409668,
+ "learning_rate": 9.669357652207635e-05,
+ "loss": 0.14821385145187377,
+ "mean_token_accuracy": 0.9503940217196941,
+ "num_tokens": 5558196.0,
+ "step": 2380
+ },
+ {
+ "epoch": 5.921544209215442,
+ "eval_entropy": 0.3322022325077722,
+ "eval_loss": 0.6722489595413208,
+ "eval_mean_token_accuracy": 0.8489979422369669,
+ "eval_num_tokens": 5558196.0,
+ "eval_runtime": 86.2986,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 2380
+ },
+ {
+ "entropy": 0.20932920072227718,
+ "epoch": 5.971357409713574,
+ "grad_norm": 0.7879557609558105,
+ "learning_rate": 9.475218688262262e-05,
+ "loss": 0.14675841331481934,
+ "mean_token_accuracy": 0.9507176131010056,
+ "num_tokens": 5605400.0,
+ "step": 2400
+ },
+ {
+ "epoch": 5.971357409713574,
+ "eval_entropy": 0.3199348642902319,
+ "eval_loss": 0.6698136329650879,
+ "eval_mean_token_accuracy": 0.8514142130003419,
+ "eval_num_tokens": 5605400.0,
+ "eval_runtime": 85.8995,
+ "eval_samples_per_second": 16.007,
+ "eval_steps_per_second": 2.002,
+ "step": 2400
+ },
+ {
+ "entropy": 0.21032143919131693,
+ "epoch": 6.019925280199253,
+ "grad_norm": 0.5823076367378235,
+ "learning_rate": 9.281634267491569e-05,
+ "loss": 0.13322267532348633,
+ "mean_token_accuracy": 0.9550939072401096,
+ "num_tokens": 5648968.0,
+ "step": 2420
+ },
+ {
+ "epoch": 6.019925280199253,
+ "eval_entropy": 0.30206270117399303,
+ "eval_loss": 0.7093168497085571,
+ "eval_mean_token_accuracy": 0.8500627639681794,
+ "eval_num_tokens": 5648968.0,
+ "eval_runtime": 85.8128,
+ "eval_samples_per_second": 16.023,
+ "eval_steps_per_second": 2.004,
+ "step": 2420
+ },
+ {
+ "entropy": 0.1534628233872354,
+ "epoch": 6.069738480697385,
+ "grad_norm": 0.710133969783783,
+ "learning_rate": 9.088662772316508e-05,
+ "loss": 0.09078952670097351,
+ "mean_token_accuracy": 0.9678447999060154,
+ "num_tokens": 5697633.0,
+ "step": 2440
+ },
+ {
+ "epoch": 6.069738480697385,
+ "eval_entropy": 0.28208133101809857,
+ "eval_loss": 0.7636417150497437,
+ "eval_mean_token_accuracy": 0.8494061477655588,
+ "eval_num_tokens": 5697633.0,
+ "eval_runtime": 85.9724,
+ "eval_samples_per_second": 15.994,
+ "eval_steps_per_second": 2.001,
+ "step": 2440
+ },
+ {
+ "entropy": 0.16151462448760867,
+ "epoch": 6.119551681195516,
+ "grad_norm": 0.5793812274932861,
+ "learning_rate": 8.896362400308028e-05,
+ "loss": 0.09545697569847107,
+ "mean_token_accuracy": 0.9671573750674725,
+ "num_tokens": 5745090.0,
+ "step": 2460
+ },
+ {
+ "epoch": 6.119551681195516,
+ "eval_entropy": 0.2833245605403601,
+ "eval_loss": 0.7402405738830566,
+ "eval_mean_token_accuracy": 0.8503523728875226,
+ "eval_num_tokens": 5745090.0,
+ "eval_runtime": 85.5461,
+ "eval_samples_per_second": 16.073,
+ "eval_steps_per_second": 2.011,
+ "step": 2460
+ },
+ {
+ "entropy": 0.15203177919611335,
+ "epoch": 6.169364881693649,
+ "grad_norm": 0.4251123368740082,
+ "learning_rate": 8.704791146635483e-05,
+ "loss": 0.09420782327651978,
+ "mean_token_accuracy": 0.9677386932075024,
+ "num_tokens": 5790333.0,
+ "step": 2480
+ },
+ {
+ "epoch": 6.169364881693649,
+ "eval_entropy": 0.28572545962971313,
+ "eval_loss": 0.735416829586029,
+ "eval_mean_token_accuracy": 0.8487084663884584,
+ "eval_num_tokens": 5790333.0,
+ "eval_runtime": 85.4801,
+ "eval_samples_per_second": 16.086,
+ "eval_steps_per_second": 2.012,
+ "step": 2480
+ },
+ {
+ "entropy": 0.15587336672469973,
+ "epoch": 6.219178082191781,
+ "grad_norm": 0.4357028007507324,
+ "learning_rate": 8.514006786576085e-05,
+ "loss": 0.09429320096969604,
+ "mean_token_accuracy": 0.9682952925562859,
+ "num_tokens": 5837321.0,
+ "step": 2500
+ },
+ {
+ "epoch": 6.219178082191781,
+ "eval_entropy": 0.2859006894882335,
+ "eval_loss": 0.7347224950790405,
+ "eval_mean_token_accuracy": 0.8501905518215757,
+ "eval_num_tokens": 5837321.0,
+ "eval_runtime": 85.7578,
+ "eval_samples_per_second": 16.034,
+ "eval_steps_per_second": 2.006,
+ "step": 2500
+ },
+ {
+ "entropy": 0.15765639198943973,
+ "epoch": 6.268991282689913,
+ "grad_norm": 0.47331130504608154,
+ "learning_rate": 8.324066858090663e-05,
+ "loss": 0.09571113586425781,
+ "mean_token_accuracy": 0.9683481335639954,
+ "num_tokens": 5884398.0,
+ "step": 2520
+ },
+ {
+ "epoch": 6.268991282689913,
+ "eval_entropy": 0.29231513846059176,
+ "eval_loss": 0.7392512559890747,
+ "eval_mean_token_accuracy": 0.8486633983462356,
+ "eval_num_tokens": 5884398.0,
+ "eval_runtime": 85.7846,
+ "eval_samples_per_second": 16.029,
+ "eval_steps_per_second": 2.005,
+ "step": 2520
+ },
+ {
+ "entropy": 0.16176860257983208,
+ "epoch": 6.318804483188045,
+ "grad_norm": 0.6142018437385559,
+ "learning_rate": 8.135028644470992e-05,
+ "loss": 0.09486144185066223,
+ "mean_token_accuracy": 0.9682316601276397,
+ "num_tokens": 5929876.0,
+ "step": 2540
+ },
+ {
+ "epoch": 6.318804483188045,
+ "eval_entropy": 0.2851274753379267,
+ "eval_loss": 0.7520816922187805,
+ "eval_mean_token_accuracy": 0.8501113649717597,
+ "eval_num_tokens": 5929876.0,
+ "eval_runtime": 85.9425,
+ "eval_samples_per_second": 15.999,
+ "eval_steps_per_second": 2.001,
+ "step": 2540
+ },
+ {
+ "entropy": 0.15404034564271568,
+ "epoch": 6.3686176836861765,
+ "grad_norm": 0.6051287651062012,
+ "learning_rate": 7.946949157063964e-05,
+ "loss": 0.09280472993850708,
+ "mean_token_accuracy": 0.9684635892510414,
+ "num_tokens": 5978490.0,
+ "step": 2560
+ },
+ {
+ "epoch": 6.3686176836861765,
+ "eval_entropy": 0.28802703563557114,
+ "eval_loss": 0.7439162135124207,
+ "eval_mean_token_accuracy": 0.8499851770872293,
+ "eval_num_tokens": 5978490.0,
+ "eval_runtime": 86.0703,
+ "eval_samples_per_second": 15.975,
+ "eval_steps_per_second": 1.998,
+ "step": 2560
+ },
+ {
+ "entropy": 0.15343588953837753,
+ "epoch": 6.418430884184309,
+ "grad_norm": 0.4823743402957916,
+ "learning_rate": 7.759885118077701e-05,
+ "loss": 0.09000591039657593,
+ "mean_token_accuracy": 0.9699928767979145,
+ "num_tokens": 6025380.0,
+ "step": 2580
+ },
+ {
+ "epoch": 6.418430884184309,
+ "eval_entropy": 0.2795634938533916,
+ "eval_loss": 0.7647850513458252,
+ "eval_mean_token_accuracy": 0.8503464397995971,
+ "eval_num_tokens": 6025380.0,
+ "eval_runtime": 85.8886,
+ "eval_samples_per_second": 16.009,
+ "eval_steps_per_second": 2.003,
+ "step": 2580
+ },
+ {
+ "entropy": 0.15740026142448188,
+ "epoch": 6.468244084682441,
+ "grad_norm": 0.5082696676254272,
+ "learning_rate": 7.57389294347494e-05,
+ "loss": 0.09191849827766418,
+ "mean_token_accuracy": 0.9692809768021107,
+ "num_tokens": 6073349.0,
+ "step": 2600
+ },
+ {
+ "epoch": 6.468244084682441,
+ "eval_entropy": 0.2913342311458532,
+ "eval_loss": 0.7518694996833801,
+ "eval_mean_token_accuracy": 0.8483168302580367,
+ "eval_num_tokens": 6073349.0,
+ "eval_runtime": 85.5761,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.01,
+ "step": 2600
+ },
+ {
+ "entropy": 0.15922069251537324,
+ "epoch": 6.518057285180573,
+ "grad_norm": 0.3995199501514435,
+ "learning_rate": 7.389028725958736e-05,
+ "loss": 0.09584367871284485,
+ "mean_token_accuracy": 0.9685114495456218,
+ "num_tokens": 6118148.0,
+ "step": 2620
+ },
+ {
+ "epoch": 6.518057285180573,
+ "eval_entropy": 0.2863075934177221,
+ "eval_loss": 0.7539381384849548,
+ "eval_mean_token_accuracy": 0.8507507083027862,
+ "eval_num_tokens": 6118148.0,
+ "eval_runtime": 86.112,
+ "eval_samples_per_second": 15.968,
+ "eval_steps_per_second": 1.997,
+ "step": 2620
+ },
+ {
+ "entropy": 0.16197575423866512,
+ "epoch": 6.567870485678705,
+ "grad_norm": 0.534295380115509,
+ "learning_rate": 7.205348218055678e-05,
+ "loss": 0.0961170256137848,
+ "mean_token_accuracy": 0.9674530044198036,
+ "num_tokens": 6165523.0,
+ "step": 2640
+ },
+ {
+ "epoch": 6.567870485678705,
+ "eval_entropy": 0.29021967315050057,
+ "eval_loss": 0.751198947429657,
+ "eval_mean_token_accuracy": 0.8509796344956686,
+ "eval_num_tokens": 6165523.0,
+ "eval_runtime": 85.7958,
+ "eval_samples_per_second": 16.026,
+ "eval_steps_per_second": 2.005,
+ "step": 2640
+ },
+ {
+ "entropy": 0.15261746793985367,
+ "epoch": 6.617683686176837,
+ "grad_norm": 0.5391237139701843,
+ "learning_rate": 7.022906815301673e-05,
+ "loss": 0.0926026999950409,
+ "mean_token_accuracy": 0.9695659473538398,
+ "num_tokens": 6216232.0,
+ "step": 2660
+ },
+ {
+ "epoch": 6.617683686176837,
+ "eval_entropy": 0.29128045216202736,
+ "eval_loss": 0.7450292110443115,
+ "eval_mean_token_accuracy": 0.8498771443616512,
+ "eval_num_tokens": 6216232.0,
+ "eval_runtime": 86.3963,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 2660
+ },
+ {
+ "entropy": 0.16164180357009172,
+ "epoch": 6.667496886674969,
+ "grad_norm": 0.5767946243286133,
+ "learning_rate": 6.841759539535419e-05,
+ "loss": 0.09291981458663941,
+ "mean_token_accuracy": 0.9687136687338352,
+ "num_tokens": 6264807.0,
+ "step": 2680
+ },
+ {
+ "epoch": 6.667496886674969,
+ "eval_entropy": 0.2897637223088464,
+ "eval_loss": 0.7503410577774048,
+ "eval_mean_token_accuracy": 0.8503315164599308,
+ "eval_num_tokens": 6264807.0,
+ "eval_runtime": 86.0653,
+ "eval_samples_per_second": 15.976,
+ "eval_steps_per_second": 1.998,
+ "step": 2680
+ },
+ {
+ "entropy": 0.17062523355707526,
+ "epoch": 6.717310087173101,
+ "grad_norm": 0.4974168539047241,
+ "learning_rate": 6.661961022304563e-05,
+ "loss": 0.09713236689567566,
+ "mean_token_accuracy": 0.9661971725523472,
+ "num_tokens": 6308819.0,
+ "step": 2700
+ },
+ {
+ "epoch": 6.717310087173101,
+ "eval_entropy": 0.2765843396963075,
+ "eval_loss": 0.7604002356529236,
+ "eval_mean_token_accuracy": 0.8521115277395692,
+ "eval_num_tokens": 6308819.0,
+ "eval_runtime": 86.1676,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 2700
+ },
+ {
+ "entropy": 0.17544092936441302,
+ "epoch": 6.767123287671232,
+ "grad_norm": 0.5523537993431091,
+ "learning_rate": 6.483565488389582e-05,
+ "loss": 0.09709116220474243,
+ "mean_token_accuracy": 0.9650957375764847,
+ "num_tokens": 6352548.0,
+ "step": 2720
+ },
+ {
+ "epoch": 6.767123287671232,
+ "eval_entropy": 0.27939334659035814,
+ "eval_loss": 0.7534670829772949,
+ "eval_mean_token_accuracy": 0.851230604010959,
+ "eval_num_tokens": 6352548.0,
+ "eval_runtime": 86.2913,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 2720
+ },
+ {
+ "entropy": 0.15991022661328316,
+ "epoch": 6.816936488169365,
+ "grad_norm": 0.478551983833313,
+ "learning_rate": 6.306626739450311e-05,
+ "loss": 0.09564646482467651,
+ "mean_token_accuracy": 0.9679084822535515,
+ "num_tokens": 6397720.0,
+ "step": 2740
+ },
+ {
+ "epoch": 6.816936488169365,
+ "eval_entropy": 0.27878295491601146,
+ "eval_loss": 0.7519959211349487,
+ "eval_mean_token_accuracy": 0.8510654949864676,
+ "eval_num_tokens": 6397720.0,
+ "eval_runtime": 85.9109,
+ "eval_samples_per_second": 16.005,
+ "eval_steps_per_second": 2.002,
+ "step": 2740
+ },
+ {
+ "entropy": 0.16824879590421915,
+ "epoch": 6.866749688667497,
+ "grad_norm": 0.6681098937988281,
+ "learning_rate": 6.131198137800108e-05,
+ "loss": 0.0962279736995697,
+ "mean_token_accuracy": 0.966830012947321,
+ "num_tokens": 6442821.0,
+ "step": 2760
+ },
+ {
+ "epoch": 6.866749688667497,
+ "eval_entropy": 0.2834690434121808,
+ "eval_loss": 0.751922070980072,
+ "eval_mean_token_accuracy": 0.8521237577809844,
+ "eval_num_tokens": 6442821.0,
+ "eval_runtime": 86.3618,
+ "eval_samples_per_second": 15.921,
+ "eval_steps_per_second": 1.992,
+ "step": 2760
+ },
+ {
+ "entropy": 0.1518704930320382,
+ "epoch": 6.916562889165629,
+ "grad_norm": 0.5201290249824524,
+ "learning_rate": 5.957332590312513e-05,
+ "loss": 0.09010660648345947,
+ "mean_token_accuracy": 0.9693463340401649,
+ "num_tokens": 6494118.0,
+ "step": 2780
+ },
+ {
+ "epoch": 6.916562889165629,
+ "eval_entropy": 0.28485129617674404,
+ "eval_loss": 0.7452457547187805,
+ "eval_mean_token_accuracy": 0.8512036796919135,
+ "eval_num_tokens": 6494118.0,
+ "eval_runtime": 86.4524,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2780
+ },
+ {
+ "entropy": 0.15512610590085388,
+ "epoch": 6.966376089663761,
+ "grad_norm": 0.42802050709724426,
+ "learning_rate": 5.785082532465233e-05,
+ "loss": 0.09320432543754578,
+ "mean_token_accuracy": 0.9686134628951549,
+ "num_tokens": 6540175.0,
+ "step": 2800
+ },
+ {
+ "epoch": 6.966376089663761,
+ "eval_entropy": 0.27554594526110693,
+ "eval_loss": 0.7644653916358948,
+ "eval_mean_token_accuracy": 0.8513738523389018,
+ "eval_num_tokens": 6540175.0,
+ "eval_runtime": 85.7609,
+ "eval_samples_per_second": 16.033,
+ "eval_steps_per_second": 2.006,
+ "step": 2800
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.7583451507824435e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2820/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2820/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2820/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2820/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2820/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2820/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2820/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2820/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2820/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2820/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2820/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2820/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2820/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2820/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..3deaf34e7f0faca30a17edbf2748d4c4abe7e80e
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2820/trainer_state.json
@@ -0,0 +1,2995 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 7.01494396014944,
+ "eval_steps": 20,
+ "global_step": 2820,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ },
+ {
+ "entropy": 0.3193941755220294,
+ "epoch": 4.5280199252802,
+ "grad_norm": 0.8281906843185425,
+ "learning_rate": 0.0001509111761786888,
+ "loss": 0.23936262130737304,
+ "mean_token_accuracy": 0.9201708927750587,
+ "num_tokens": 4244423.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.5280199252802,
+ "eval_entropy": 0.38704028864239537,
+ "eval_loss": 0.6006569266319275,
+ "eval_mean_token_accuracy": 0.8502406720505205,
+ "eval_num_tokens": 4244423.0,
+ "eval_runtime": 86.8059,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1820
+ },
+ {
+ "entropy": 0.3164879363030195,
+ "epoch": 4.577833125778331,
+ "grad_norm": 0.7892968654632568,
+ "learning_rate": 0.00014905346557909867,
+ "loss": 0.24541733264923096,
+ "mean_token_accuracy": 0.9175932116806507,
+ "num_tokens": 4289773.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.577833125778331,
+ "eval_entropy": 0.38861122120951497,
+ "eval_loss": 0.6115967631340027,
+ "eval_mean_token_accuracy": 0.849471275196519,
+ "eval_num_tokens": 4289773.0,
+ "eval_runtime": 86.2946,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1840
+ },
+ {
+ "entropy": 0.3051785985007882,
+ "epoch": 4.627646326276463,
+ "grad_norm": 0.8109654188156128,
+ "learning_rate": 0.0001471849238862319,
+ "loss": 0.23433220386505127,
+ "mean_token_accuracy": 0.9206570319831371,
+ "num_tokens": 4336894.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.627646326276463,
+ "eval_entropy": 0.37162452295076015,
+ "eval_loss": 0.6184061765670776,
+ "eval_mean_token_accuracy": 0.8501173268223918,
+ "eval_num_tokens": 4336894.0,
+ "eval_runtime": 86.6865,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1860
+ },
+ {
+ "entropy": 0.3168198253959417,
+ "epoch": 4.677459526774595,
+ "grad_norm": 0.9512342214584351,
+ "learning_rate": 0.0001453061146267775,
+ "loss": 0.23832404613494873,
+ "mean_token_accuracy": 0.9197044663131237,
+ "num_tokens": 4382947.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.677459526774595,
+ "eval_entropy": 0.3845940856912801,
+ "eval_loss": 0.606762707233429,
+ "eval_mean_token_accuracy": 0.8504838194957999,
+ "eval_num_tokens": 4382947.0,
+ "eval_runtime": 86.5175,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 1880
+ },
+ {
+ "entropy": 0.30791807882487776,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 0.8123113512992859,
+ "learning_rate": 0.00014341760442398248,
+ "loss": 0.2395785331726074,
+ "mean_token_accuracy": 0.918928150832653,
+ "num_tokens": 4433050.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.7272727272727275,
+ "eval_entropy": 0.39762327222283494,
+ "eval_loss": 0.5994202494621277,
+ "eval_mean_token_accuracy": 0.8509274201337681,
+ "eval_num_tokens": 4433050.0,
+ "eval_runtime": 86.2873,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.993,
+ "step": 1900
+ },
+ {
+ "entropy": 0.3021434534341097,
+ "epoch": 4.777085927770859,
+ "grad_norm": 0.731787383556366,
+ "learning_rate": 0.000141519962826766,
+ "loss": 0.23494718074798585,
+ "mean_token_accuracy": 0.9201403826475143,
+ "num_tokens": 4483598.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.777085927770859,
+ "eval_entropy": 0.3827026732439219,
+ "eval_loss": 0.5995895862579346,
+ "eval_mean_token_accuracy": 0.851468373523202,
+ "eval_num_tokens": 4483598.0,
+ "eval_runtime": 86.3006,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 1920
+ },
+ {
+ "entropy": 0.31626159623265265,
+ "epoch": 4.826899128268991,
+ "grad_norm": 0.8848487138748169,
+ "learning_rate": 0.00013961376213795132,
+ "loss": 0.2439030647277832,
+ "mean_token_accuracy": 0.9196575872600079,
+ "num_tokens": 4529201.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.826899128268991,
+ "eval_entropy": 0.388698436839636,
+ "eval_loss": 0.6000174283981323,
+ "eval_mean_token_accuracy": 0.8518068187458571,
+ "eval_num_tokens": 4529201.0,
+ "eval_runtime": 86.8979,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.979,
+ "step": 1940
+ },
+ {
+ "entropy": 0.30520407035946845,
+ "epoch": 4.876712328767123,
+ "grad_norm": 0.8532460927963257,
+ "learning_rate": 0.00013769957724166695,
+ "loss": 0.23458616733551024,
+ "mean_token_accuracy": 0.9221912942826748,
+ "num_tokens": 4578167.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.876712328767123,
+ "eval_entropy": 0.38777847102908203,
+ "eval_loss": 0.6004981398582458,
+ "eval_mean_token_accuracy": 0.8516481768253238,
+ "eval_num_tokens": 4578167.0,
+ "eval_runtime": 87.0777,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.975,
+ "step": 1960
+ },
+ {
+ "entropy": 0.3226448342204094,
+ "epoch": 4.926525529265255,
+ "grad_norm": 0.6945561766624451,
+ "learning_rate": 0.0001357779854299694,
+ "loss": 0.24048397541046143,
+ "mean_token_accuracy": 0.9195300146937371,
+ "num_tokens": 4622316.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.926525529265255,
+ "eval_entropy": 0.38581624263247777,
+ "eval_loss": 0.6029234528541565,
+ "eval_mean_token_accuracy": 0.8514213260523108,
+ "eval_num_tokens": 4622316.0,
+ "eval_runtime": 85.8729,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 1980
+ },
+ {
+ "entropy": 0.3051655298098922,
+ "epoch": 4.976338729763388,
+ "grad_norm": 0.7976452708244324,
+ "learning_rate": 0.00013384956622874001,
+ "loss": 0.23584742546081544,
+ "mean_token_accuracy": 0.9216851457953453,
+ "num_tokens": 4670746.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.976338729763388,
+ "eval_entropy": 0.37913159246361533,
+ "eval_loss": 0.6057604551315308,
+ "eval_mean_token_accuracy": 0.8525801203971686,
+ "eval_num_tokens": 4670746.0,
+ "eval_runtime": 86.1145,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2000
+ },
+ {
+ "entropy": 0.27438195240803254,
+ "epoch": 5.024906600249066,
+ "grad_norm": 0.6729586124420166,
+ "learning_rate": 0.0001319149012229075,
+ "loss": 0.19775952100753785,
+ "mean_token_accuracy": 0.9339428559327737,
+ "num_tokens": 4716176.0,
+ "step": 2020
+ },
+ {
+ "epoch": 5.024906600249066,
+ "eval_entropy": 0.3448961910813354,
+ "eval_loss": 0.6750120520591736,
+ "eval_mean_token_accuracy": 0.8487970232963562,
+ "eval_num_tokens": 4716176.0,
+ "eval_runtime": 86.1169,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2020
+ },
+ {
+ "entropy": 0.21423916313797237,
+ "epoch": 5.074719800747198,
+ "grad_norm": 0.6934391856193542,
+ "learning_rate": 0.00012997457388105022,
+ "loss": 0.1439570426940918,
+ "mean_token_accuracy": 0.9528236843645572,
+ "num_tokens": 4763269.0,
+ "step": 2040
+ },
+ {
+ "epoch": 5.074719800747198,
+ "eval_entropy": 0.3570949243771475,
+ "eval_loss": 0.6465504169464111,
+ "eval_mean_token_accuracy": 0.8490785547467166,
+ "eval_num_tokens": 4763269.0,
+ "eval_runtime": 85.9574,
+ "eval_samples_per_second": 15.996,
+ "eval_steps_per_second": 2.001,
+ "step": 2040
+ },
+ {
+ "entropy": 0.20838565267622472,
+ "epoch": 5.12453300124533,
+ "grad_norm": 0.7286986112594604,
+ "learning_rate": 0.00012802916937942972,
+ "loss": 0.14467307329177856,
+ "mean_token_accuracy": 0.950994835793972,
+ "num_tokens": 4809047.0,
+ "step": 2060
+ },
+ {
+ "epoch": 5.12453300124533,
+ "eval_entropy": 0.3452463157821533,
+ "eval_loss": 0.6705958843231201,
+ "eval_mean_token_accuracy": 0.8490352796953778,
+ "eval_num_tokens": 4809047.0,
+ "eval_runtime": 86.228,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 2060
+ },
+ {
+ "entropy": 0.20453082229942082,
+ "epoch": 5.174346201743462,
+ "grad_norm": 0.7515555620193481,
+ "learning_rate": 0.00012607927442550974,
+ "loss": 0.13732000589370727,
+ "mean_token_accuracy": 0.9537357829511166,
+ "num_tokens": 4857965.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.174346201743462,
+ "eval_entropy": 0.32431264914745506,
+ "eval_loss": 0.6743043065071106,
+ "eval_mean_token_accuracy": 0.8504878629085629,
+ "eval_num_tokens": 4857965.0,
+ "eval_runtime": 86.5948,
+ "eval_samples_per_second": 15.879,
+ "eval_steps_per_second": 1.986,
+ "step": 2080
+ },
+ {
+ "entropy": 0.21812320686876774,
+ "epoch": 5.224159402241594,
+ "grad_norm": 0.9093465209007263,
+ "learning_rate": 0.0001241254770810132,
+ "loss": 0.14311420917510986,
+ "mean_token_accuracy": 0.9514068141579628,
+ "num_tokens": 4905151.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.224159402241594,
+ "eval_entropy": 0.33086285835435225,
+ "eval_loss": 0.6676449179649353,
+ "eval_mean_token_accuracy": 0.8505287662495015,
+ "eval_num_tokens": 4905151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 2100
+ },
+ {
+ "entropy": 0.2180163251236081,
+ "epoch": 5.273972602739726,
+ "grad_norm": 0.6703007221221924,
+ "learning_rate": 0.00012216836658457075,
+ "loss": 0.14803968667984008,
+ "mean_token_accuracy": 0.9521303348243236,
+ "num_tokens": 4947072.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.273972602739726,
+ "eval_entropy": 0.33162341708707255,
+ "eval_loss": 0.6658875942230225,
+ "eval_mean_token_accuracy": 0.8500757605530495,
+ "eval_num_tokens": 4947072.0,
+ "eval_runtime": 86.6296,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 2120
+ },
+ {
+ "entropy": 0.22511130161583423,
+ "epoch": 5.323785803237858,
+ "grad_norm": 0.8078880906105042,
+ "learning_rate": 0.00012020853317401455,
+ "loss": 0.15228408575057983,
+ "mean_token_accuracy": 0.947144789993763,
+ "num_tokens": 4991974.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.323785803237858,
+ "eval_entropy": 0.3354601170434508,
+ "eval_loss": 0.6677829623222351,
+ "eval_mean_token_accuracy": 0.8482600024273229,
+ "eval_num_tokens": 4991974.0,
+ "eval_runtime": 86.4689,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.989,
+ "step": 2140
+ },
+ {
+ "entropy": 0.2244176059961319,
+ "epoch": 5.37359900373599,
+ "grad_norm": 0.9636075496673584,
+ "learning_rate": 0.00011824656790837037,
+ "loss": 0.15260883569717407,
+ "mean_token_accuracy": 0.9471467643976211,
+ "num_tokens": 5038400.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.37359900373599,
+ "eval_entropy": 0.3381616926297199,
+ "eval_loss": 0.6694412231445312,
+ "eval_mean_token_accuracy": 0.8482369603805764,
+ "eval_num_tokens": 5038400.0,
+ "eval_runtime": 86.4147,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 2160
+ },
+ {
+ "entropy": 0.22982364390045404,
+ "epoch": 5.423412204234122,
+ "grad_norm": 0.775401771068573,
+ "learning_rate": 0.00011628306248960262,
+ "loss": 0.15140302181243898,
+ "mean_token_accuracy": 0.9492553934454918,
+ "num_tokens": 5083166.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.423412204234122,
+ "eval_entropy": 0.3305150235808173,
+ "eval_loss": 0.6717822551727295,
+ "eval_mean_token_accuracy": 0.8489849723355715,
+ "eval_num_tokens": 5083166.0,
+ "eval_runtime": 86.4728,
+ "eval_samples_per_second": 15.901,
+ "eval_steps_per_second": 1.989,
+ "step": 2180
+ },
+ {
+ "entropy": 0.21448935717344284,
+ "epoch": 5.473225404732254,
+ "grad_norm": 0.6575281023979187,
+ "learning_rate": 0.00011431860908416465,
+ "loss": 0.1452319622039795,
+ "mean_token_accuracy": 0.9505287684500218,
+ "num_tokens": 5135109.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.473225404732254,
+ "eval_entropy": 0.3488145174328671,
+ "eval_loss": 0.6612305641174316,
+ "eval_mean_token_accuracy": 0.8492907808963642,
+ "eval_num_tokens": 5135109.0,
+ "eval_runtime": 86.6927,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 2200
+ },
+ {
+ "entropy": 0.23091202937066554,
+ "epoch": 5.523038605230386,
+ "grad_norm": 0.8909686207771301,
+ "learning_rate": 0.00011235380014440985,
+ "loss": 0.15150139331817628,
+ "mean_token_accuracy": 0.9497875183820724,
+ "num_tokens": 5180138.0,
+ "step": 2220
+ },
+ {
+ "epoch": 5.523038605230386,
+ "eval_entropy": 0.3268539015810157,
+ "eval_loss": 0.6667542457580566,
+ "eval_mean_token_accuracy": 0.8499062903398691,
+ "eval_num_tokens": 5180138.0,
+ "eval_runtime": 86.4644,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 2220
+ },
+ {
+ "entropy": 0.2227974807843566,
+ "epoch": 5.572851805728518,
+ "grad_norm": 0.6180275082588196,
+ "learning_rate": 0.0001103892282299158,
+ "loss": 0.1491069197654724,
+ "mean_token_accuracy": 0.9488144010305405,
+ "num_tokens": 5226864.0,
+ "step": 2240
+ },
+ {
+ "epoch": 5.572851805728518,
+ "eval_entropy": 0.3346347655494546,
+ "eval_loss": 0.6665948629379272,
+ "eval_mean_token_accuracy": 0.8499961893918903,
+ "eval_num_tokens": 5226864.0,
+ "eval_runtime": 87.0548,
+ "eval_samples_per_second": 15.795,
+ "eval_steps_per_second": 1.976,
+ "step": 2240
+ },
+ {
+ "entropy": 0.21368421968072654,
+ "epoch": 5.62266500622665,
+ "grad_norm": 0.6004369258880615,
+ "learning_rate": 0.00010842548582877651,
+ "loss": 0.14485255479812623,
+ "mean_token_accuracy": 0.9502056457102299,
+ "num_tokens": 5276602.0,
+ "step": 2260
+ },
+ {
+ "epoch": 5.62266500622665,
+ "eval_entropy": 0.32753298804163933,
+ "eval_loss": 0.6680151224136353,
+ "eval_mean_token_accuracy": 0.8515451086121936,
+ "eval_num_tokens": 5276602.0,
+ "eval_runtime": 86.8524,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.98,
+ "step": 2260
+ },
+ {
+ "entropy": 0.2103635374456644,
+ "epoch": 5.672478206724782,
+ "grad_norm": 0.699174702167511,
+ "learning_rate": 0.00010646316517891613,
+ "loss": 0.14297772645950318,
+ "mean_token_accuracy": 0.9512537539005279,
+ "num_tokens": 5323718.0,
+ "step": 2280
+ },
+ {
+ "epoch": 5.672478206724782,
+ "eval_entropy": 0.32966585959806,
+ "eval_loss": 0.675578773021698,
+ "eval_mean_token_accuracy": 0.8509623023659684,
+ "eval_num_tokens": 5323718.0,
+ "eval_runtime": 86.4518,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2280
+ },
+ {
+ "entropy": 0.22516900151968003,
+ "epoch": 5.722291407222914,
+ "grad_norm": 0.6637354493141174,
+ "learning_rate": 0.00010450285808947797,
+ "loss": 0.15202572345733642,
+ "mean_token_accuracy": 0.9482452072203159,
+ "num_tokens": 5369039.0,
+ "step": 2300
+ },
+ {
+ "epoch": 5.722291407222914,
+ "eval_entropy": 0.3369456917740578,
+ "eval_loss": 0.6697061061859131,
+ "eval_mean_token_accuracy": 0.848603522361711,
+ "eval_num_tokens": 5369039.0,
+ "eval_runtime": 86.6371,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.985,
+ "step": 2300
+ },
+ {
+ "entropy": 0.21841065725311637,
+ "epoch": 5.772104607721046,
+ "grad_norm": 0.7940268516540527,
+ "learning_rate": 0.00010254515576234297,
+ "loss": 0.14710167646408082,
+ "mean_token_accuracy": 0.9493498183786869,
+ "num_tokens": 5417029.0,
+ "step": 2320
+ },
+ {
+ "epoch": 5.772104607721046,
+ "eval_entropy": 0.3237486180177955,
+ "eval_loss": 0.6779657602310181,
+ "eval_mean_token_accuracy": 0.8500715313955794,
+ "eval_num_tokens": 5417029.0,
+ "eval_runtime": 86.1826,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 1.996,
+ "step": 2320
+ },
+ {
+ "entropy": 0.22146204356104135,
+ "epoch": 5.821917808219178,
+ "grad_norm": 0.9234833121299744,
+ "learning_rate": 0.00010059064861383132,
+ "loss": 0.14720046520233154,
+ "mean_token_accuracy": 0.9493872679769992,
+ "num_tokens": 5461671.0,
+ "step": 2340
+ },
+ {
+ "epoch": 5.821917808219178,
+ "eval_entropy": 0.32365207564692167,
+ "eval_loss": 0.6704005002975464,
+ "eval_mean_token_accuracy": 0.8507985760306203,
+ "eval_num_tokens": 5461671.0,
+ "eval_runtime": 86.5494,
+ "eval_samples_per_second": 15.887,
+ "eval_steps_per_second": 1.987,
+ "step": 2340
+ },
+ {
+ "entropy": 0.20934011954814197,
+ "epoch": 5.87173100871731,
+ "grad_norm": 0.5547503232955933,
+ "learning_rate": 9.863992609664084e-05,
+ "loss": 0.1464867353439331,
+ "mean_token_accuracy": 0.9503875687718392,
+ "num_tokens": 5509312.0,
+ "step": 2360
+ },
+ {
+ "epoch": 5.87173100871731,
+ "eval_entropy": 0.3330401429083458,
+ "eval_loss": 0.6659091114997864,
+ "eval_mean_token_accuracy": 0.8504848906467127,
+ "eval_num_tokens": 5509312.0,
+ "eval_runtime": 86.5855,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 2360
+ },
+ {
+ "entropy": 0.21678635366261007,
+ "epoch": 5.921544209215442,
+ "grad_norm": 0.570612907409668,
+ "learning_rate": 9.669357652207635e-05,
+ "loss": 0.14821385145187377,
+ "mean_token_accuracy": 0.9503940217196941,
+ "num_tokens": 5558196.0,
+ "step": 2380
+ },
+ {
+ "epoch": 5.921544209215442,
+ "eval_entropy": 0.3322022325077722,
+ "eval_loss": 0.6722489595413208,
+ "eval_mean_token_accuracy": 0.8489979422369669,
+ "eval_num_tokens": 5558196.0,
+ "eval_runtime": 86.2986,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 2380
+ },
+ {
+ "entropy": 0.20932920072227718,
+ "epoch": 5.971357409713574,
+ "grad_norm": 0.7879557609558105,
+ "learning_rate": 9.475218688262262e-05,
+ "loss": 0.14675841331481934,
+ "mean_token_accuracy": 0.9507176131010056,
+ "num_tokens": 5605400.0,
+ "step": 2400
+ },
+ {
+ "epoch": 5.971357409713574,
+ "eval_entropy": 0.3199348642902319,
+ "eval_loss": 0.6698136329650879,
+ "eval_mean_token_accuracy": 0.8514142130003419,
+ "eval_num_tokens": 5605400.0,
+ "eval_runtime": 85.8995,
+ "eval_samples_per_second": 16.007,
+ "eval_steps_per_second": 2.002,
+ "step": 2400
+ },
+ {
+ "entropy": 0.21032143919131693,
+ "epoch": 6.019925280199253,
+ "grad_norm": 0.5823076367378235,
+ "learning_rate": 9.281634267491569e-05,
+ "loss": 0.13322267532348633,
+ "mean_token_accuracy": 0.9550939072401096,
+ "num_tokens": 5648968.0,
+ "step": 2420
+ },
+ {
+ "epoch": 6.019925280199253,
+ "eval_entropy": 0.30206270117399303,
+ "eval_loss": 0.7093168497085571,
+ "eval_mean_token_accuracy": 0.8500627639681794,
+ "eval_num_tokens": 5648968.0,
+ "eval_runtime": 85.8128,
+ "eval_samples_per_second": 16.023,
+ "eval_steps_per_second": 2.004,
+ "step": 2420
+ },
+ {
+ "entropy": 0.1534628233872354,
+ "epoch": 6.069738480697385,
+ "grad_norm": 0.710133969783783,
+ "learning_rate": 9.088662772316508e-05,
+ "loss": 0.09078952670097351,
+ "mean_token_accuracy": 0.9678447999060154,
+ "num_tokens": 5697633.0,
+ "step": 2440
+ },
+ {
+ "epoch": 6.069738480697385,
+ "eval_entropy": 0.28208133101809857,
+ "eval_loss": 0.7636417150497437,
+ "eval_mean_token_accuracy": 0.8494061477655588,
+ "eval_num_tokens": 5697633.0,
+ "eval_runtime": 85.9724,
+ "eval_samples_per_second": 15.994,
+ "eval_steps_per_second": 2.001,
+ "step": 2440
+ },
+ {
+ "entropy": 0.16151462448760867,
+ "epoch": 6.119551681195516,
+ "grad_norm": 0.5793812274932861,
+ "learning_rate": 8.896362400308028e-05,
+ "loss": 0.09545697569847107,
+ "mean_token_accuracy": 0.9671573750674725,
+ "num_tokens": 5745090.0,
+ "step": 2460
+ },
+ {
+ "epoch": 6.119551681195516,
+ "eval_entropy": 0.2833245605403601,
+ "eval_loss": 0.7402405738830566,
+ "eval_mean_token_accuracy": 0.8503523728875226,
+ "eval_num_tokens": 5745090.0,
+ "eval_runtime": 85.5461,
+ "eval_samples_per_second": 16.073,
+ "eval_steps_per_second": 2.011,
+ "step": 2460
+ },
+ {
+ "entropy": 0.15203177919611335,
+ "epoch": 6.169364881693649,
+ "grad_norm": 0.4251123368740082,
+ "learning_rate": 8.704791146635483e-05,
+ "loss": 0.09420782327651978,
+ "mean_token_accuracy": 0.9677386932075024,
+ "num_tokens": 5790333.0,
+ "step": 2480
+ },
+ {
+ "epoch": 6.169364881693649,
+ "eval_entropy": 0.28572545962971313,
+ "eval_loss": 0.735416829586029,
+ "eval_mean_token_accuracy": 0.8487084663884584,
+ "eval_num_tokens": 5790333.0,
+ "eval_runtime": 85.4801,
+ "eval_samples_per_second": 16.086,
+ "eval_steps_per_second": 2.012,
+ "step": 2480
+ },
+ {
+ "entropy": 0.15587336672469973,
+ "epoch": 6.219178082191781,
+ "grad_norm": 0.4357028007507324,
+ "learning_rate": 8.514006786576085e-05,
+ "loss": 0.09429320096969604,
+ "mean_token_accuracy": 0.9682952925562859,
+ "num_tokens": 5837321.0,
+ "step": 2500
+ },
+ {
+ "epoch": 6.219178082191781,
+ "eval_entropy": 0.2859006894882335,
+ "eval_loss": 0.7347224950790405,
+ "eval_mean_token_accuracy": 0.8501905518215757,
+ "eval_num_tokens": 5837321.0,
+ "eval_runtime": 85.7578,
+ "eval_samples_per_second": 16.034,
+ "eval_steps_per_second": 2.006,
+ "step": 2500
+ },
+ {
+ "entropy": 0.15765639198943973,
+ "epoch": 6.268991282689913,
+ "grad_norm": 0.47331130504608154,
+ "learning_rate": 8.324066858090663e-05,
+ "loss": 0.09571113586425781,
+ "mean_token_accuracy": 0.9683481335639954,
+ "num_tokens": 5884398.0,
+ "step": 2520
+ },
+ {
+ "epoch": 6.268991282689913,
+ "eval_entropy": 0.29231513846059176,
+ "eval_loss": 0.7392512559890747,
+ "eval_mean_token_accuracy": 0.8486633983462356,
+ "eval_num_tokens": 5884398.0,
+ "eval_runtime": 85.7846,
+ "eval_samples_per_second": 16.029,
+ "eval_steps_per_second": 2.005,
+ "step": 2520
+ },
+ {
+ "entropy": 0.16176860257983208,
+ "epoch": 6.318804483188045,
+ "grad_norm": 0.6142018437385559,
+ "learning_rate": 8.135028644470992e-05,
+ "loss": 0.09486144185066223,
+ "mean_token_accuracy": 0.9682316601276397,
+ "num_tokens": 5929876.0,
+ "step": 2540
+ },
+ {
+ "epoch": 6.318804483188045,
+ "eval_entropy": 0.2851274753379267,
+ "eval_loss": 0.7520816922187805,
+ "eval_mean_token_accuracy": 0.8501113649717597,
+ "eval_num_tokens": 5929876.0,
+ "eval_runtime": 85.9425,
+ "eval_samples_per_second": 15.999,
+ "eval_steps_per_second": 2.001,
+ "step": 2540
+ },
+ {
+ "entropy": 0.15404034564271568,
+ "epoch": 6.3686176836861765,
+ "grad_norm": 0.6051287651062012,
+ "learning_rate": 7.946949157063964e-05,
+ "loss": 0.09280472993850708,
+ "mean_token_accuracy": 0.9684635892510414,
+ "num_tokens": 5978490.0,
+ "step": 2560
+ },
+ {
+ "epoch": 6.3686176836861765,
+ "eval_entropy": 0.28802703563557114,
+ "eval_loss": 0.7439162135124207,
+ "eval_mean_token_accuracy": 0.8499851770872293,
+ "eval_num_tokens": 5978490.0,
+ "eval_runtime": 86.0703,
+ "eval_samples_per_second": 15.975,
+ "eval_steps_per_second": 1.998,
+ "step": 2560
+ },
+ {
+ "entropy": 0.15343588953837753,
+ "epoch": 6.418430884184309,
+ "grad_norm": 0.4823743402957916,
+ "learning_rate": 7.759885118077701e-05,
+ "loss": 0.09000591039657593,
+ "mean_token_accuracy": 0.9699928767979145,
+ "num_tokens": 6025380.0,
+ "step": 2580
+ },
+ {
+ "epoch": 6.418430884184309,
+ "eval_entropy": 0.2795634938533916,
+ "eval_loss": 0.7647850513458252,
+ "eval_mean_token_accuracy": 0.8503464397995971,
+ "eval_num_tokens": 6025380.0,
+ "eval_runtime": 85.8886,
+ "eval_samples_per_second": 16.009,
+ "eval_steps_per_second": 2.003,
+ "step": 2580
+ },
+ {
+ "entropy": 0.15740026142448188,
+ "epoch": 6.468244084682441,
+ "grad_norm": 0.5082696676254272,
+ "learning_rate": 7.57389294347494e-05,
+ "loss": 0.09191849827766418,
+ "mean_token_accuracy": 0.9692809768021107,
+ "num_tokens": 6073349.0,
+ "step": 2600
+ },
+ {
+ "epoch": 6.468244084682441,
+ "eval_entropy": 0.2913342311458532,
+ "eval_loss": 0.7518694996833801,
+ "eval_mean_token_accuracy": 0.8483168302580367,
+ "eval_num_tokens": 6073349.0,
+ "eval_runtime": 85.5761,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.01,
+ "step": 2600
+ },
+ {
+ "entropy": 0.15922069251537324,
+ "epoch": 6.518057285180573,
+ "grad_norm": 0.3995199501514435,
+ "learning_rate": 7.389028725958736e-05,
+ "loss": 0.09584367871284485,
+ "mean_token_accuracy": 0.9685114495456218,
+ "num_tokens": 6118148.0,
+ "step": 2620
+ },
+ {
+ "epoch": 6.518057285180573,
+ "eval_entropy": 0.2863075934177221,
+ "eval_loss": 0.7539381384849548,
+ "eval_mean_token_accuracy": 0.8507507083027862,
+ "eval_num_tokens": 6118148.0,
+ "eval_runtime": 86.112,
+ "eval_samples_per_second": 15.968,
+ "eval_steps_per_second": 1.997,
+ "step": 2620
+ },
+ {
+ "entropy": 0.16197575423866512,
+ "epoch": 6.567870485678705,
+ "grad_norm": 0.534295380115509,
+ "learning_rate": 7.205348218055678e-05,
+ "loss": 0.0961170256137848,
+ "mean_token_accuracy": 0.9674530044198036,
+ "num_tokens": 6165523.0,
+ "step": 2640
+ },
+ {
+ "epoch": 6.567870485678705,
+ "eval_entropy": 0.29021967315050057,
+ "eval_loss": 0.751198947429657,
+ "eval_mean_token_accuracy": 0.8509796344956686,
+ "eval_num_tokens": 6165523.0,
+ "eval_runtime": 85.7958,
+ "eval_samples_per_second": 16.026,
+ "eval_steps_per_second": 2.005,
+ "step": 2640
+ },
+ {
+ "entropy": 0.15261746793985367,
+ "epoch": 6.617683686176837,
+ "grad_norm": 0.5391237139701843,
+ "learning_rate": 7.022906815301673e-05,
+ "loss": 0.0926026999950409,
+ "mean_token_accuracy": 0.9695659473538398,
+ "num_tokens": 6216232.0,
+ "step": 2660
+ },
+ {
+ "epoch": 6.617683686176837,
+ "eval_entropy": 0.29128045216202736,
+ "eval_loss": 0.7450292110443115,
+ "eval_mean_token_accuracy": 0.8498771443616512,
+ "eval_num_tokens": 6216232.0,
+ "eval_runtime": 86.3963,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 2660
+ },
+ {
+ "entropy": 0.16164180357009172,
+ "epoch": 6.667496886674969,
+ "grad_norm": 0.5767946243286133,
+ "learning_rate": 6.841759539535419e-05,
+ "loss": 0.09291981458663941,
+ "mean_token_accuracy": 0.9687136687338352,
+ "num_tokens": 6264807.0,
+ "step": 2680
+ },
+ {
+ "epoch": 6.667496886674969,
+ "eval_entropy": 0.2897637223088464,
+ "eval_loss": 0.7503410577774048,
+ "eval_mean_token_accuracy": 0.8503315164599308,
+ "eval_num_tokens": 6264807.0,
+ "eval_runtime": 86.0653,
+ "eval_samples_per_second": 15.976,
+ "eval_steps_per_second": 1.998,
+ "step": 2680
+ },
+ {
+ "entropy": 0.17062523355707526,
+ "epoch": 6.717310087173101,
+ "grad_norm": 0.4974168539047241,
+ "learning_rate": 6.661961022304563e-05,
+ "loss": 0.09713236689567566,
+ "mean_token_accuracy": 0.9661971725523472,
+ "num_tokens": 6308819.0,
+ "step": 2700
+ },
+ {
+ "epoch": 6.717310087173101,
+ "eval_entropy": 0.2765843396963075,
+ "eval_loss": 0.7604002356529236,
+ "eval_mean_token_accuracy": 0.8521115277395692,
+ "eval_num_tokens": 6308819.0,
+ "eval_runtime": 86.1676,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 2700
+ },
+ {
+ "entropy": 0.17544092936441302,
+ "epoch": 6.767123287671232,
+ "grad_norm": 0.5523537993431091,
+ "learning_rate": 6.483565488389582e-05,
+ "loss": 0.09709116220474243,
+ "mean_token_accuracy": 0.9650957375764847,
+ "num_tokens": 6352548.0,
+ "step": 2720
+ },
+ {
+ "epoch": 6.767123287671232,
+ "eval_entropy": 0.27939334659035814,
+ "eval_loss": 0.7534670829772949,
+ "eval_mean_token_accuracy": 0.851230604010959,
+ "eval_num_tokens": 6352548.0,
+ "eval_runtime": 86.2913,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 2720
+ },
+ {
+ "entropy": 0.15991022661328316,
+ "epoch": 6.816936488169365,
+ "grad_norm": 0.478551983833313,
+ "learning_rate": 6.306626739450311e-05,
+ "loss": 0.09564646482467651,
+ "mean_token_accuracy": 0.9679084822535515,
+ "num_tokens": 6397720.0,
+ "step": 2740
+ },
+ {
+ "epoch": 6.816936488169365,
+ "eval_entropy": 0.27878295491601146,
+ "eval_loss": 0.7519959211349487,
+ "eval_mean_token_accuracy": 0.8510654949864676,
+ "eval_num_tokens": 6397720.0,
+ "eval_runtime": 85.9109,
+ "eval_samples_per_second": 16.005,
+ "eval_steps_per_second": 2.002,
+ "step": 2740
+ },
+ {
+ "entropy": 0.16824879590421915,
+ "epoch": 6.866749688667497,
+ "grad_norm": 0.6681098937988281,
+ "learning_rate": 6.131198137800108e-05,
+ "loss": 0.0962279736995697,
+ "mean_token_accuracy": 0.966830012947321,
+ "num_tokens": 6442821.0,
+ "step": 2760
+ },
+ {
+ "epoch": 6.866749688667497,
+ "eval_entropy": 0.2834690434121808,
+ "eval_loss": 0.751922070980072,
+ "eval_mean_token_accuracy": 0.8521237577809844,
+ "eval_num_tokens": 6442821.0,
+ "eval_runtime": 86.3618,
+ "eval_samples_per_second": 15.921,
+ "eval_steps_per_second": 1.992,
+ "step": 2760
+ },
+ {
+ "entropy": 0.1518704930320382,
+ "epoch": 6.916562889165629,
+ "grad_norm": 0.5201290249824524,
+ "learning_rate": 5.957332590312513e-05,
+ "loss": 0.09010660648345947,
+ "mean_token_accuracy": 0.9693463340401649,
+ "num_tokens": 6494118.0,
+ "step": 2780
+ },
+ {
+ "epoch": 6.916562889165629,
+ "eval_entropy": 0.28485129617674404,
+ "eval_loss": 0.7452457547187805,
+ "eval_mean_token_accuracy": 0.8512036796919135,
+ "eval_num_tokens": 6494118.0,
+ "eval_runtime": 86.4524,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2780
+ },
+ {
+ "entropy": 0.15512610590085388,
+ "epoch": 6.966376089663761,
+ "grad_norm": 0.42802050709724426,
+ "learning_rate": 5.785082532465233e-05,
+ "loss": 0.09320432543754578,
+ "mean_token_accuracy": 0.9686134628951549,
+ "num_tokens": 6540175.0,
+ "step": 2800
+ },
+ {
+ "epoch": 6.966376089663761,
+ "eval_entropy": 0.27554594526110693,
+ "eval_loss": 0.7644653916358948,
+ "eval_mean_token_accuracy": 0.8513738523389018,
+ "eval_num_tokens": 6540175.0,
+ "eval_runtime": 85.7609,
+ "eval_samples_per_second": 16.033,
+ "eval_steps_per_second": 2.006,
+ "step": 2800
+ },
+ {
+ "entropy": 0.17524497526196334,
+ "epoch": 7.01494396014944,
+ "grad_norm": 0.3330269157886505,
+ "learning_rate": 5.6144999125263545e-05,
+ "loss": 0.0895616888999939,
+ "mean_token_accuracy": 0.9682766932707566,
+ "num_tokens": 6583767.0,
+ "step": 2820
+ },
+ {
+ "epoch": 7.01494396014944,
+ "eval_entropy": 0.2735865569218647,
+ "eval_loss": 0.768479585647583,
+ "eval_mean_token_accuracy": 0.8503459383581959,
+ "eval_num_tokens": 6583767.0,
+ "eval_runtime": 85.7162,
+ "eval_samples_per_second": 16.041,
+ "eval_steps_per_second": 2.007,
+ "step": 2820
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.77769206341974e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2840/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2840/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2840/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2840/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2840/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2840/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2840/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2840/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2840/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2840/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2840/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2840/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2840/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2840/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..4846ed36417fff59ae2c89ebc222d5a0925391d6
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2840/trainer_state.json
@@ -0,0 +1,3016 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 7.064757160647572,
+ "eval_steps": 20,
+ "global_step": 2840,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ },
+ {
+ "entropy": 0.3193941755220294,
+ "epoch": 4.5280199252802,
+ "grad_norm": 0.8281906843185425,
+ "learning_rate": 0.0001509111761786888,
+ "loss": 0.23936262130737304,
+ "mean_token_accuracy": 0.9201708927750587,
+ "num_tokens": 4244423.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.5280199252802,
+ "eval_entropy": 0.38704028864239537,
+ "eval_loss": 0.6006569266319275,
+ "eval_mean_token_accuracy": 0.8502406720505205,
+ "eval_num_tokens": 4244423.0,
+ "eval_runtime": 86.8059,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1820
+ },
+ {
+ "entropy": 0.3164879363030195,
+ "epoch": 4.577833125778331,
+ "grad_norm": 0.7892968654632568,
+ "learning_rate": 0.00014905346557909867,
+ "loss": 0.24541733264923096,
+ "mean_token_accuracy": 0.9175932116806507,
+ "num_tokens": 4289773.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.577833125778331,
+ "eval_entropy": 0.38861122120951497,
+ "eval_loss": 0.6115967631340027,
+ "eval_mean_token_accuracy": 0.849471275196519,
+ "eval_num_tokens": 4289773.0,
+ "eval_runtime": 86.2946,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1840
+ },
+ {
+ "entropy": 0.3051785985007882,
+ "epoch": 4.627646326276463,
+ "grad_norm": 0.8109654188156128,
+ "learning_rate": 0.0001471849238862319,
+ "loss": 0.23433220386505127,
+ "mean_token_accuracy": 0.9206570319831371,
+ "num_tokens": 4336894.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.627646326276463,
+ "eval_entropy": 0.37162452295076015,
+ "eval_loss": 0.6184061765670776,
+ "eval_mean_token_accuracy": 0.8501173268223918,
+ "eval_num_tokens": 4336894.0,
+ "eval_runtime": 86.6865,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1860
+ },
+ {
+ "entropy": 0.3168198253959417,
+ "epoch": 4.677459526774595,
+ "grad_norm": 0.9512342214584351,
+ "learning_rate": 0.0001453061146267775,
+ "loss": 0.23832404613494873,
+ "mean_token_accuracy": 0.9197044663131237,
+ "num_tokens": 4382947.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.677459526774595,
+ "eval_entropy": 0.3845940856912801,
+ "eval_loss": 0.606762707233429,
+ "eval_mean_token_accuracy": 0.8504838194957999,
+ "eval_num_tokens": 4382947.0,
+ "eval_runtime": 86.5175,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 1880
+ },
+ {
+ "entropy": 0.30791807882487776,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 0.8123113512992859,
+ "learning_rate": 0.00014341760442398248,
+ "loss": 0.2395785331726074,
+ "mean_token_accuracy": 0.918928150832653,
+ "num_tokens": 4433050.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.7272727272727275,
+ "eval_entropy": 0.39762327222283494,
+ "eval_loss": 0.5994202494621277,
+ "eval_mean_token_accuracy": 0.8509274201337681,
+ "eval_num_tokens": 4433050.0,
+ "eval_runtime": 86.2873,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.993,
+ "step": 1900
+ },
+ {
+ "entropy": 0.3021434534341097,
+ "epoch": 4.777085927770859,
+ "grad_norm": 0.731787383556366,
+ "learning_rate": 0.000141519962826766,
+ "loss": 0.23494718074798585,
+ "mean_token_accuracy": 0.9201403826475143,
+ "num_tokens": 4483598.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.777085927770859,
+ "eval_entropy": 0.3827026732439219,
+ "eval_loss": 0.5995895862579346,
+ "eval_mean_token_accuracy": 0.851468373523202,
+ "eval_num_tokens": 4483598.0,
+ "eval_runtime": 86.3006,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 1920
+ },
+ {
+ "entropy": 0.31626159623265265,
+ "epoch": 4.826899128268991,
+ "grad_norm": 0.8848487138748169,
+ "learning_rate": 0.00013961376213795132,
+ "loss": 0.2439030647277832,
+ "mean_token_accuracy": 0.9196575872600079,
+ "num_tokens": 4529201.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.826899128268991,
+ "eval_entropy": 0.388698436839636,
+ "eval_loss": 0.6000174283981323,
+ "eval_mean_token_accuracy": 0.8518068187458571,
+ "eval_num_tokens": 4529201.0,
+ "eval_runtime": 86.8979,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.979,
+ "step": 1940
+ },
+ {
+ "entropy": 0.30520407035946845,
+ "epoch": 4.876712328767123,
+ "grad_norm": 0.8532460927963257,
+ "learning_rate": 0.00013769957724166695,
+ "loss": 0.23458616733551024,
+ "mean_token_accuracy": 0.9221912942826748,
+ "num_tokens": 4578167.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.876712328767123,
+ "eval_entropy": 0.38777847102908203,
+ "eval_loss": 0.6004981398582458,
+ "eval_mean_token_accuracy": 0.8516481768253238,
+ "eval_num_tokens": 4578167.0,
+ "eval_runtime": 87.0777,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.975,
+ "step": 1960
+ },
+ {
+ "entropy": 0.3226448342204094,
+ "epoch": 4.926525529265255,
+ "grad_norm": 0.6945561766624451,
+ "learning_rate": 0.0001357779854299694,
+ "loss": 0.24048397541046143,
+ "mean_token_accuracy": 0.9195300146937371,
+ "num_tokens": 4622316.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.926525529265255,
+ "eval_entropy": 0.38581624263247777,
+ "eval_loss": 0.6029234528541565,
+ "eval_mean_token_accuracy": 0.8514213260523108,
+ "eval_num_tokens": 4622316.0,
+ "eval_runtime": 85.8729,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 1980
+ },
+ {
+ "entropy": 0.3051655298098922,
+ "epoch": 4.976338729763388,
+ "grad_norm": 0.7976452708244324,
+ "learning_rate": 0.00013384956622874001,
+ "loss": 0.23584742546081544,
+ "mean_token_accuracy": 0.9216851457953453,
+ "num_tokens": 4670746.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.976338729763388,
+ "eval_entropy": 0.37913159246361533,
+ "eval_loss": 0.6057604551315308,
+ "eval_mean_token_accuracy": 0.8525801203971686,
+ "eval_num_tokens": 4670746.0,
+ "eval_runtime": 86.1145,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2000
+ },
+ {
+ "entropy": 0.27438195240803254,
+ "epoch": 5.024906600249066,
+ "grad_norm": 0.6729586124420166,
+ "learning_rate": 0.0001319149012229075,
+ "loss": 0.19775952100753785,
+ "mean_token_accuracy": 0.9339428559327737,
+ "num_tokens": 4716176.0,
+ "step": 2020
+ },
+ {
+ "epoch": 5.024906600249066,
+ "eval_entropy": 0.3448961910813354,
+ "eval_loss": 0.6750120520591736,
+ "eval_mean_token_accuracy": 0.8487970232963562,
+ "eval_num_tokens": 4716176.0,
+ "eval_runtime": 86.1169,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2020
+ },
+ {
+ "entropy": 0.21423916313797237,
+ "epoch": 5.074719800747198,
+ "grad_norm": 0.6934391856193542,
+ "learning_rate": 0.00012997457388105022,
+ "loss": 0.1439570426940918,
+ "mean_token_accuracy": 0.9528236843645572,
+ "num_tokens": 4763269.0,
+ "step": 2040
+ },
+ {
+ "epoch": 5.074719800747198,
+ "eval_entropy": 0.3570949243771475,
+ "eval_loss": 0.6465504169464111,
+ "eval_mean_token_accuracy": 0.8490785547467166,
+ "eval_num_tokens": 4763269.0,
+ "eval_runtime": 85.9574,
+ "eval_samples_per_second": 15.996,
+ "eval_steps_per_second": 2.001,
+ "step": 2040
+ },
+ {
+ "entropy": 0.20838565267622472,
+ "epoch": 5.12453300124533,
+ "grad_norm": 0.7286986112594604,
+ "learning_rate": 0.00012802916937942972,
+ "loss": 0.14467307329177856,
+ "mean_token_accuracy": 0.950994835793972,
+ "num_tokens": 4809047.0,
+ "step": 2060
+ },
+ {
+ "epoch": 5.12453300124533,
+ "eval_entropy": 0.3452463157821533,
+ "eval_loss": 0.6705958843231201,
+ "eval_mean_token_accuracy": 0.8490352796953778,
+ "eval_num_tokens": 4809047.0,
+ "eval_runtime": 86.228,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 2060
+ },
+ {
+ "entropy": 0.20453082229942082,
+ "epoch": 5.174346201743462,
+ "grad_norm": 0.7515555620193481,
+ "learning_rate": 0.00012607927442550974,
+ "loss": 0.13732000589370727,
+ "mean_token_accuracy": 0.9537357829511166,
+ "num_tokens": 4857965.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.174346201743462,
+ "eval_entropy": 0.32431264914745506,
+ "eval_loss": 0.6743043065071106,
+ "eval_mean_token_accuracy": 0.8504878629085629,
+ "eval_num_tokens": 4857965.0,
+ "eval_runtime": 86.5948,
+ "eval_samples_per_second": 15.879,
+ "eval_steps_per_second": 1.986,
+ "step": 2080
+ },
+ {
+ "entropy": 0.21812320686876774,
+ "epoch": 5.224159402241594,
+ "grad_norm": 0.9093465209007263,
+ "learning_rate": 0.0001241254770810132,
+ "loss": 0.14311420917510986,
+ "mean_token_accuracy": 0.9514068141579628,
+ "num_tokens": 4905151.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.224159402241594,
+ "eval_entropy": 0.33086285835435225,
+ "eval_loss": 0.6676449179649353,
+ "eval_mean_token_accuracy": 0.8505287662495015,
+ "eval_num_tokens": 4905151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 2100
+ },
+ {
+ "entropy": 0.2180163251236081,
+ "epoch": 5.273972602739726,
+ "grad_norm": 0.6703007221221924,
+ "learning_rate": 0.00012216836658457075,
+ "loss": 0.14803968667984008,
+ "mean_token_accuracy": 0.9521303348243236,
+ "num_tokens": 4947072.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.273972602739726,
+ "eval_entropy": 0.33162341708707255,
+ "eval_loss": 0.6658875942230225,
+ "eval_mean_token_accuracy": 0.8500757605530495,
+ "eval_num_tokens": 4947072.0,
+ "eval_runtime": 86.6296,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 2120
+ },
+ {
+ "entropy": 0.22511130161583423,
+ "epoch": 5.323785803237858,
+ "grad_norm": 0.8078880906105042,
+ "learning_rate": 0.00012020853317401455,
+ "loss": 0.15228408575057983,
+ "mean_token_accuracy": 0.947144789993763,
+ "num_tokens": 4991974.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.323785803237858,
+ "eval_entropy": 0.3354601170434508,
+ "eval_loss": 0.6677829623222351,
+ "eval_mean_token_accuracy": 0.8482600024273229,
+ "eval_num_tokens": 4991974.0,
+ "eval_runtime": 86.4689,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.989,
+ "step": 2140
+ },
+ {
+ "entropy": 0.2244176059961319,
+ "epoch": 5.37359900373599,
+ "grad_norm": 0.9636075496673584,
+ "learning_rate": 0.00011824656790837037,
+ "loss": 0.15260883569717407,
+ "mean_token_accuracy": 0.9471467643976211,
+ "num_tokens": 5038400.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.37359900373599,
+ "eval_entropy": 0.3381616926297199,
+ "eval_loss": 0.6694412231445312,
+ "eval_mean_token_accuracy": 0.8482369603805764,
+ "eval_num_tokens": 5038400.0,
+ "eval_runtime": 86.4147,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 2160
+ },
+ {
+ "entropy": 0.22982364390045404,
+ "epoch": 5.423412204234122,
+ "grad_norm": 0.775401771068573,
+ "learning_rate": 0.00011628306248960262,
+ "loss": 0.15140302181243898,
+ "mean_token_accuracy": 0.9492553934454918,
+ "num_tokens": 5083166.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.423412204234122,
+ "eval_entropy": 0.3305150235808173,
+ "eval_loss": 0.6717822551727295,
+ "eval_mean_token_accuracy": 0.8489849723355715,
+ "eval_num_tokens": 5083166.0,
+ "eval_runtime": 86.4728,
+ "eval_samples_per_second": 15.901,
+ "eval_steps_per_second": 1.989,
+ "step": 2180
+ },
+ {
+ "entropy": 0.21448935717344284,
+ "epoch": 5.473225404732254,
+ "grad_norm": 0.6575281023979187,
+ "learning_rate": 0.00011431860908416465,
+ "loss": 0.1452319622039795,
+ "mean_token_accuracy": 0.9505287684500218,
+ "num_tokens": 5135109.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.473225404732254,
+ "eval_entropy": 0.3488145174328671,
+ "eval_loss": 0.6612305641174316,
+ "eval_mean_token_accuracy": 0.8492907808963642,
+ "eval_num_tokens": 5135109.0,
+ "eval_runtime": 86.6927,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 2200
+ },
+ {
+ "entropy": 0.23091202937066554,
+ "epoch": 5.523038605230386,
+ "grad_norm": 0.8909686207771301,
+ "learning_rate": 0.00011235380014440985,
+ "loss": 0.15150139331817628,
+ "mean_token_accuracy": 0.9497875183820724,
+ "num_tokens": 5180138.0,
+ "step": 2220
+ },
+ {
+ "epoch": 5.523038605230386,
+ "eval_entropy": 0.3268539015810157,
+ "eval_loss": 0.6667542457580566,
+ "eval_mean_token_accuracy": 0.8499062903398691,
+ "eval_num_tokens": 5180138.0,
+ "eval_runtime": 86.4644,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 2220
+ },
+ {
+ "entropy": 0.2227974807843566,
+ "epoch": 5.572851805728518,
+ "grad_norm": 0.6180275082588196,
+ "learning_rate": 0.0001103892282299158,
+ "loss": 0.1491069197654724,
+ "mean_token_accuracy": 0.9488144010305405,
+ "num_tokens": 5226864.0,
+ "step": 2240
+ },
+ {
+ "epoch": 5.572851805728518,
+ "eval_entropy": 0.3346347655494546,
+ "eval_loss": 0.6665948629379272,
+ "eval_mean_token_accuracy": 0.8499961893918903,
+ "eval_num_tokens": 5226864.0,
+ "eval_runtime": 87.0548,
+ "eval_samples_per_second": 15.795,
+ "eval_steps_per_second": 1.976,
+ "step": 2240
+ },
+ {
+ "entropy": 0.21368421968072654,
+ "epoch": 5.62266500622665,
+ "grad_norm": 0.6004369258880615,
+ "learning_rate": 0.00010842548582877651,
+ "loss": 0.14485255479812623,
+ "mean_token_accuracy": 0.9502056457102299,
+ "num_tokens": 5276602.0,
+ "step": 2260
+ },
+ {
+ "epoch": 5.62266500622665,
+ "eval_entropy": 0.32753298804163933,
+ "eval_loss": 0.6680151224136353,
+ "eval_mean_token_accuracy": 0.8515451086121936,
+ "eval_num_tokens": 5276602.0,
+ "eval_runtime": 86.8524,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.98,
+ "step": 2260
+ },
+ {
+ "entropy": 0.2103635374456644,
+ "epoch": 5.672478206724782,
+ "grad_norm": 0.699174702167511,
+ "learning_rate": 0.00010646316517891613,
+ "loss": 0.14297772645950318,
+ "mean_token_accuracy": 0.9512537539005279,
+ "num_tokens": 5323718.0,
+ "step": 2280
+ },
+ {
+ "epoch": 5.672478206724782,
+ "eval_entropy": 0.32966585959806,
+ "eval_loss": 0.675578773021698,
+ "eval_mean_token_accuracy": 0.8509623023659684,
+ "eval_num_tokens": 5323718.0,
+ "eval_runtime": 86.4518,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2280
+ },
+ {
+ "entropy": 0.22516900151968003,
+ "epoch": 5.722291407222914,
+ "grad_norm": 0.6637354493141174,
+ "learning_rate": 0.00010450285808947797,
+ "loss": 0.15202572345733642,
+ "mean_token_accuracy": 0.9482452072203159,
+ "num_tokens": 5369039.0,
+ "step": 2300
+ },
+ {
+ "epoch": 5.722291407222914,
+ "eval_entropy": 0.3369456917740578,
+ "eval_loss": 0.6697061061859131,
+ "eval_mean_token_accuracy": 0.848603522361711,
+ "eval_num_tokens": 5369039.0,
+ "eval_runtime": 86.6371,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.985,
+ "step": 2300
+ },
+ {
+ "entropy": 0.21841065725311637,
+ "epoch": 5.772104607721046,
+ "grad_norm": 0.7940268516540527,
+ "learning_rate": 0.00010254515576234297,
+ "loss": 0.14710167646408082,
+ "mean_token_accuracy": 0.9493498183786869,
+ "num_tokens": 5417029.0,
+ "step": 2320
+ },
+ {
+ "epoch": 5.772104607721046,
+ "eval_entropy": 0.3237486180177955,
+ "eval_loss": 0.6779657602310181,
+ "eval_mean_token_accuracy": 0.8500715313955794,
+ "eval_num_tokens": 5417029.0,
+ "eval_runtime": 86.1826,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 1.996,
+ "step": 2320
+ },
+ {
+ "entropy": 0.22146204356104135,
+ "epoch": 5.821917808219178,
+ "grad_norm": 0.9234833121299744,
+ "learning_rate": 0.00010059064861383132,
+ "loss": 0.14720046520233154,
+ "mean_token_accuracy": 0.9493872679769992,
+ "num_tokens": 5461671.0,
+ "step": 2340
+ },
+ {
+ "epoch": 5.821917808219178,
+ "eval_entropy": 0.32365207564692167,
+ "eval_loss": 0.6704005002975464,
+ "eval_mean_token_accuracy": 0.8507985760306203,
+ "eval_num_tokens": 5461671.0,
+ "eval_runtime": 86.5494,
+ "eval_samples_per_second": 15.887,
+ "eval_steps_per_second": 1.987,
+ "step": 2340
+ },
+ {
+ "entropy": 0.20934011954814197,
+ "epoch": 5.87173100871731,
+ "grad_norm": 0.5547503232955933,
+ "learning_rate": 9.863992609664084e-05,
+ "loss": 0.1464867353439331,
+ "mean_token_accuracy": 0.9503875687718392,
+ "num_tokens": 5509312.0,
+ "step": 2360
+ },
+ {
+ "epoch": 5.87173100871731,
+ "eval_entropy": 0.3330401429083458,
+ "eval_loss": 0.6659091114997864,
+ "eval_mean_token_accuracy": 0.8504848906467127,
+ "eval_num_tokens": 5509312.0,
+ "eval_runtime": 86.5855,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 2360
+ },
+ {
+ "entropy": 0.21678635366261007,
+ "epoch": 5.921544209215442,
+ "grad_norm": 0.570612907409668,
+ "learning_rate": 9.669357652207635e-05,
+ "loss": 0.14821385145187377,
+ "mean_token_accuracy": 0.9503940217196941,
+ "num_tokens": 5558196.0,
+ "step": 2380
+ },
+ {
+ "epoch": 5.921544209215442,
+ "eval_entropy": 0.3322022325077722,
+ "eval_loss": 0.6722489595413208,
+ "eval_mean_token_accuracy": 0.8489979422369669,
+ "eval_num_tokens": 5558196.0,
+ "eval_runtime": 86.2986,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 2380
+ },
+ {
+ "entropy": 0.20932920072227718,
+ "epoch": 5.971357409713574,
+ "grad_norm": 0.7879557609558105,
+ "learning_rate": 9.475218688262262e-05,
+ "loss": 0.14675841331481934,
+ "mean_token_accuracy": 0.9507176131010056,
+ "num_tokens": 5605400.0,
+ "step": 2400
+ },
+ {
+ "epoch": 5.971357409713574,
+ "eval_entropy": 0.3199348642902319,
+ "eval_loss": 0.6698136329650879,
+ "eval_mean_token_accuracy": 0.8514142130003419,
+ "eval_num_tokens": 5605400.0,
+ "eval_runtime": 85.8995,
+ "eval_samples_per_second": 16.007,
+ "eval_steps_per_second": 2.002,
+ "step": 2400
+ },
+ {
+ "entropy": 0.21032143919131693,
+ "epoch": 6.019925280199253,
+ "grad_norm": 0.5823076367378235,
+ "learning_rate": 9.281634267491569e-05,
+ "loss": 0.13322267532348633,
+ "mean_token_accuracy": 0.9550939072401096,
+ "num_tokens": 5648968.0,
+ "step": 2420
+ },
+ {
+ "epoch": 6.019925280199253,
+ "eval_entropy": 0.30206270117399303,
+ "eval_loss": 0.7093168497085571,
+ "eval_mean_token_accuracy": 0.8500627639681794,
+ "eval_num_tokens": 5648968.0,
+ "eval_runtime": 85.8128,
+ "eval_samples_per_second": 16.023,
+ "eval_steps_per_second": 2.004,
+ "step": 2420
+ },
+ {
+ "entropy": 0.1534628233872354,
+ "epoch": 6.069738480697385,
+ "grad_norm": 0.710133969783783,
+ "learning_rate": 9.088662772316508e-05,
+ "loss": 0.09078952670097351,
+ "mean_token_accuracy": 0.9678447999060154,
+ "num_tokens": 5697633.0,
+ "step": 2440
+ },
+ {
+ "epoch": 6.069738480697385,
+ "eval_entropy": 0.28208133101809857,
+ "eval_loss": 0.7636417150497437,
+ "eval_mean_token_accuracy": 0.8494061477655588,
+ "eval_num_tokens": 5697633.0,
+ "eval_runtime": 85.9724,
+ "eval_samples_per_second": 15.994,
+ "eval_steps_per_second": 2.001,
+ "step": 2440
+ },
+ {
+ "entropy": 0.16151462448760867,
+ "epoch": 6.119551681195516,
+ "grad_norm": 0.5793812274932861,
+ "learning_rate": 8.896362400308028e-05,
+ "loss": 0.09545697569847107,
+ "mean_token_accuracy": 0.9671573750674725,
+ "num_tokens": 5745090.0,
+ "step": 2460
+ },
+ {
+ "epoch": 6.119551681195516,
+ "eval_entropy": 0.2833245605403601,
+ "eval_loss": 0.7402405738830566,
+ "eval_mean_token_accuracy": 0.8503523728875226,
+ "eval_num_tokens": 5745090.0,
+ "eval_runtime": 85.5461,
+ "eval_samples_per_second": 16.073,
+ "eval_steps_per_second": 2.011,
+ "step": 2460
+ },
+ {
+ "entropy": 0.15203177919611335,
+ "epoch": 6.169364881693649,
+ "grad_norm": 0.4251123368740082,
+ "learning_rate": 8.704791146635483e-05,
+ "loss": 0.09420782327651978,
+ "mean_token_accuracy": 0.9677386932075024,
+ "num_tokens": 5790333.0,
+ "step": 2480
+ },
+ {
+ "epoch": 6.169364881693649,
+ "eval_entropy": 0.28572545962971313,
+ "eval_loss": 0.735416829586029,
+ "eval_mean_token_accuracy": 0.8487084663884584,
+ "eval_num_tokens": 5790333.0,
+ "eval_runtime": 85.4801,
+ "eval_samples_per_second": 16.086,
+ "eval_steps_per_second": 2.012,
+ "step": 2480
+ },
+ {
+ "entropy": 0.15587336672469973,
+ "epoch": 6.219178082191781,
+ "grad_norm": 0.4357028007507324,
+ "learning_rate": 8.514006786576085e-05,
+ "loss": 0.09429320096969604,
+ "mean_token_accuracy": 0.9682952925562859,
+ "num_tokens": 5837321.0,
+ "step": 2500
+ },
+ {
+ "epoch": 6.219178082191781,
+ "eval_entropy": 0.2859006894882335,
+ "eval_loss": 0.7347224950790405,
+ "eval_mean_token_accuracy": 0.8501905518215757,
+ "eval_num_tokens": 5837321.0,
+ "eval_runtime": 85.7578,
+ "eval_samples_per_second": 16.034,
+ "eval_steps_per_second": 2.006,
+ "step": 2500
+ },
+ {
+ "entropy": 0.15765639198943973,
+ "epoch": 6.268991282689913,
+ "grad_norm": 0.47331130504608154,
+ "learning_rate": 8.324066858090663e-05,
+ "loss": 0.09571113586425781,
+ "mean_token_accuracy": 0.9683481335639954,
+ "num_tokens": 5884398.0,
+ "step": 2520
+ },
+ {
+ "epoch": 6.268991282689913,
+ "eval_entropy": 0.29231513846059176,
+ "eval_loss": 0.7392512559890747,
+ "eval_mean_token_accuracy": 0.8486633983462356,
+ "eval_num_tokens": 5884398.0,
+ "eval_runtime": 85.7846,
+ "eval_samples_per_second": 16.029,
+ "eval_steps_per_second": 2.005,
+ "step": 2520
+ },
+ {
+ "entropy": 0.16176860257983208,
+ "epoch": 6.318804483188045,
+ "grad_norm": 0.6142018437385559,
+ "learning_rate": 8.135028644470992e-05,
+ "loss": 0.09486144185066223,
+ "mean_token_accuracy": 0.9682316601276397,
+ "num_tokens": 5929876.0,
+ "step": 2540
+ },
+ {
+ "epoch": 6.318804483188045,
+ "eval_entropy": 0.2851274753379267,
+ "eval_loss": 0.7520816922187805,
+ "eval_mean_token_accuracy": 0.8501113649717597,
+ "eval_num_tokens": 5929876.0,
+ "eval_runtime": 85.9425,
+ "eval_samples_per_second": 15.999,
+ "eval_steps_per_second": 2.001,
+ "step": 2540
+ },
+ {
+ "entropy": 0.15404034564271568,
+ "epoch": 6.3686176836861765,
+ "grad_norm": 0.6051287651062012,
+ "learning_rate": 7.946949157063964e-05,
+ "loss": 0.09280472993850708,
+ "mean_token_accuracy": 0.9684635892510414,
+ "num_tokens": 5978490.0,
+ "step": 2560
+ },
+ {
+ "epoch": 6.3686176836861765,
+ "eval_entropy": 0.28802703563557114,
+ "eval_loss": 0.7439162135124207,
+ "eval_mean_token_accuracy": 0.8499851770872293,
+ "eval_num_tokens": 5978490.0,
+ "eval_runtime": 86.0703,
+ "eval_samples_per_second": 15.975,
+ "eval_steps_per_second": 1.998,
+ "step": 2560
+ },
+ {
+ "entropy": 0.15343588953837753,
+ "epoch": 6.418430884184309,
+ "grad_norm": 0.4823743402957916,
+ "learning_rate": 7.759885118077701e-05,
+ "loss": 0.09000591039657593,
+ "mean_token_accuracy": 0.9699928767979145,
+ "num_tokens": 6025380.0,
+ "step": 2580
+ },
+ {
+ "epoch": 6.418430884184309,
+ "eval_entropy": 0.2795634938533916,
+ "eval_loss": 0.7647850513458252,
+ "eval_mean_token_accuracy": 0.8503464397995971,
+ "eval_num_tokens": 6025380.0,
+ "eval_runtime": 85.8886,
+ "eval_samples_per_second": 16.009,
+ "eval_steps_per_second": 2.003,
+ "step": 2580
+ },
+ {
+ "entropy": 0.15740026142448188,
+ "epoch": 6.468244084682441,
+ "grad_norm": 0.5082696676254272,
+ "learning_rate": 7.57389294347494e-05,
+ "loss": 0.09191849827766418,
+ "mean_token_accuracy": 0.9692809768021107,
+ "num_tokens": 6073349.0,
+ "step": 2600
+ },
+ {
+ "epoch": 6.468244084682441,
+ "eval_entropy": 0.2913342311458532,
+ "eval_loss": 0.7518694996833801,
+ "eval_mean_token_accuracy": 0.8483168302580367,
+ "eval_num_tokens": 6073349.0,
+ "eval_runtime": 85.5761,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.01,
+ "step": 2600
+ },
+ {
+ "entropy": 0.15922069251537324,
+ "epoch": 6.518057285180573,
+ "grad_norm": 0.3995199501514435,
+ "learning_rate": 7.389028725958736e-05,
+ "loss": 0.09584367871284485,
+ "mean_token_accuracy": 0.9685114495456218,
+ "num_tokens": 6118148.0,
+ "step": 2620
+ },
+ {
+ "epoch": 6.518057285180573,
+ "eval_entropy": 0.2863075934177221,
+ "eval_loss": 0.7539381384849548,
+ "eval_mean_token_accuracy": 0.8507507083027862,
+ "eval_num_tokens": 6118148.0,
+ "eval_runtime": 86.112,
+ "eval_samples_per_second": 15.968,
+ "eval_steps_per_second": 1.997,
+ "step": 2620
+ },
+ {
+ "entropy": 0.16197575423866512,
+ "epoch": 6.567870485678705,
+ "grad_norm": 0.534295380115509,
+ "learning_rate": 7.205348218055678e-05,
+ "loss": 0.0961170256137848,
+ "mean_token_accuracy": 0.9674530044198036,
+ "num_tokens": 6165523.0,
+ "step": 2640
+ },
+ {
+ "epoch": 6.567870485678705,
+ "eval_entropy": 0.29021967315050057,
+ "eval_loss": 0.751198947429657,
+ "eval_mean_token_accuracy": 0.8509796344956686,
+ "eval_num_tokens": 6165523.0,
+ "eval_runtime": 85.7958,
+ "eval_samples_per_second": 16.026,
+ "eval_steps_per_second": 2.005,
+ "step": 2640
+ },
+ {
+ "entropy": 0.15261746793985367,
+ "epoch": 6.617683686176837,
+ "grad_norm": 0.5391237139701843,
+ "learning_rate": 7.022906815301673e-05,
+ "loss": 0.0926026999950409,
+ "mean_token_accuracy": 0.9695659473538398,
+ "num_tokens": 6216232.0,
+ "step": 2660
+ },
+ {
+ "epoch": 6.617683686176837,
+ "eval_entropy": 0.29128045216202736,
+ "eval_loss": 0.7450292110443115,
+ "eval_mean_token_accuracy": 0.8498771443616512,
+ "eval_num_tokens": 6216232.0,
+ "eval_runtime": 86.3963,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 2660
+ },
+ {
+ "entropy": 0.16164180357009172,
+ "epoch": 6.667496886674969,
+ "grad_norm": 0.5767946243286133,
+ "learning_rate": 6.841759539535419e-05,
+ "loss": 0.09291981458663941,
+ "mean_token_accuracy": 0.9687136687338352,
+ "num_tokens": 6264807.0,
+ "step": 2680
+ },
+ {
+ "epoch": 6.667496886674969,
+ "eval_entropy": 0.2897637223088464,
+ "eval_loss": 0.7503410577774048,
+ "eval_mean_token_accuracy": 0.8503315164599308,
+ "eval_num_tokens": 6264807.0,
+ "eval_runtime": 86.0653,
+ "eval_samples_per_second": 15.976,
+ "eval_steps_per_second": 1.998,
+ "step": 2680
+ },
+ {
+ "entropy": 0.17062523355707526,
+ "epoch": 6.717310087173101,
+ "grad_norm": 0.4974168539047241,
+ "learning_rate": 6.661961022304563e-05,
+ "loss": 0.09713236689567566,
+ "mean_token_accuracy": 0.9661971725523472,
+ "num_tokens": 6308819.0,
+ "step": 2700
+ },
+ {
+ "epoch": 6.717310087173101,
+ "eval_entropy": 0.2765843396963075,
+ "eval_loss": 0.7604002356529236,
+ "eval_mean_token_accuracy": 0.8521115277395692,
+ "eval_num_tokens": 6308819.0,
+ "eval_runtime": 86.1676,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 2700
+ },
+ {
+ "entropy": 0.17544092936441302,
+ "epoch": 6.767123287671232,
+ "grad_norm": 0.5523537993431091,
+ "learning_rate": 6.483565488389582e-05,
+ "loss": 0.09709116220474243,
+ "mean_token_accuracy": 0.9650957375764847,
+ "num_tokens": 6352548.0,
+ "step": 2720
+ },
+ {
+ "epoch": 6.767123287671232,
+ "eval_entropy": 0.27939334659035814,
+ "eval_loss": 0.7534670829772949,
+ "eval_mean_token_accuracy": 0.851230604010959,
+ "eval_num_tokens": 6352548.0,
+ "eval_runtime": 86.2913,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 2720
+ },
+ {
+ "entropy": 0.15991022661328316,
+ "epoch": 6.816936488169365,
+ "grad_norm": 0.478551983833313,
+ "learning_rate": 6.306626739450311e-05,
+ "loss": 0.09564646482467651,
+ "mean_token_accuracy": 0.9679084822535515,
+ "num_tokens": 6397720.0,
+ "step": 2740
+ },
+ {
+ "epoch": 6.816936488169365,
+ "eval_entropy": 0.27878295491601146,
+ "eval_loss": 0.7519959211349487,
+ "eval_mean_token_accuracy": 0.8510654949864676,
+ "eval_num_tokens": 6397720.0,
+ "eval_runtime": 85.9109,
+ "eval_samples_per_second": 16.005,
+ "eval_steps_per_second": 2.002,
+ "step": 2740
+ },
+ {
+ "entropy": 0.16824879590421915,
+ "epoch": 6.866749688667497,
+ "grad_norm": 0.6681098937988281,
+ "learning_rate": 6.131198137800108e-05,
+ "loss": 0.0962279736995697,
+ "mean_token_accuracy": 0.966830012947321,
+ "num_tokens": 6442821.0,
+ "step": 2760
+ },
+ {
+ "epoch": 6.866749688667497,
+ "eval_entropy": 0.2834690434121808,
+ "eval_loss": 0.751922070980072,
+ "eval_mean_token_accuracy": 0.8521237577809844,
+ "eval_num_tokens": 6442821.0,
+ "eval_runtime": 86.3618,
+ "eval_samples_per_second": 15.921,
+ "eval_steps_per_second": 1.992,
+ "step": 2760
+ },
+ {
+ "entropy": 0.1518704930320382,
+ "epoch": 6.916562889165629,
+ "grad_norm": 0.5201290249824524,
+ "learning_rate": 5.957332590312513e-05,
+ "loss": 0.09010660648345947,
+ "mean_token_accuracy": 0.9693463340401649,
+ "num_tokens": 6494118.0,
+ "step": 2780
+ },
+ {
+ "epoch": 6.916562889165629,
+ "eval_entropy": 0.28485129617674404,
+ "eval_loss": 0.7452457547187805,
+ "eval_mean_token_accuracy": 0.8512036796919135,
+ "eval_num_tokens": 6494118.0,
+ "eval_runtime": 86.4524,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2780
+ },
+ {
+ "entropy": 0.15512610590085388,
+ "epoch": 6.966376089663761,
+ "grad_norm": 0.42802050709724426,
+ "learning_rate": 5.785082532465233e-05,
+ "loss": 0.09320432543754578,
+ "mean_token_accuracy": 0.9686134628951549,
+ "num_tokens": 6540175.0,
+ "step": 2800
+ },
+ {
+ "epoch": 6.966376089663761,
+ "eval_entropy": 0.27554594526110693,
+ "eval_loss": 0.7644653916358948,
+ "eval_mean_token_accuracy": 0.8513738523389018,
+ "eval_num_tokens": 6540175.0,
+ "eval_runtime": 85.7609,
+ "eval_samples_per_second": 16.033,
+ "eval_steps_per_second": 2.006,
+ "step": 2800
+ },
+ {
+ "entropy": 0.17524497526196334,
+ "epoch": 7.01494396014944,
+ "grad_norm": 0.3330269157886505,
+ "learning_rate": 5.6144999125263545e-05,
+ "loss": 0.0895616888999939,
+ "mean_token_accuracy": 0.9682766932707566,
+ "num_tokens": 6583767.0,
+ "step": 2820
+ },
+ {
+ "epoch": 7.01494396014944,
+ "eval_entropy": 0.2735865569218647,
+ "eval_loss": 0.768479585647583,
+ "eval_mean_token_accuracy": 0.8503459383581959,
+ "eval_num_tokens": 6583767.0,
+ "eval_runtime": 85.7162,
+ "eval_samples_per_second": 16.041,
+ "eval_steps_per_second": 2.007,
+ "step": 2820
+ },
+ {
+ "entropy": 0.1403565663844347,
+ "epoch": 7.064757160647572,
+ "grad_norm": 0.35613498091697693,
+ "learning_rate": 5.4456361758874235e-05,
+ "loss": 0.07551313638687134,
+ "mean_token_accuracy": 0.9739301167428493,
+ "num_tokens": 6627672.0,
+ "step": 2840
+ },
+ {
+ "epoch": 7.064757160647572,
+ "eval_entropy": 0.25941789089593775,
+ "eval_loss": 0.8209511637687683,
+ "eval_mean_token_accuracy": 0.8505055855873019,
+ "eval_num_tokens": 6627672.0,
+ "eval_runtime": 86.0943,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 2840
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.7960413146222387e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2860/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2860/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2860/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2860/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2860/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2860/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2860/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2860/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2860/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2860/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2860/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2860/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2860/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2860/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..710ad2c6c97d5057e1fc4edaadc23f832ff4e84f
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2860/trainer_state.json
@@ -0,0 +1,3037 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 7.114570361145703,
+ "eval_steps": 20,
+ "global_step": 2860,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ },
+ {
+ "entropy": 0.3193941755220294,
+ "epoch": 4.5280199252802,
+ "grad_norm": 0.8281906843185425,
+ "learning_rate": 0.0001509111761786888,
+ "loss": 0.23936262130737304,
+ "mean_token_accuracy": 0.9201708927750587,
+ "num_tokens": 4244423.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.5280199252802,
+ "eval_entropy": 0.38704028864239537,
+ "eval_loss": 0.6006569266319275,
+ "eval_mean_token_accuracy": 0.8502406720505205,
+ "eval_num_tokens": 4244423.0,
+ "eval_runtime": 86.8059,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1820
+ },
+ {
+ "entropy": 0.3164879363030195,
+ "epoch": 4.577833125778331,
+ "grad_norm": 0.7892968654632568,
+ "learning_rate": 0.00014905346557909867,
+ "loss": 0.24541733264923096,
+ "mean_token_accuracy": 0.9175932116806507,
+ "num_tokens": 4289773.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.577833125778331,
+ "eval_entropy": 0.38861122120951497,
+ "eval_loss": 0.6115967631340027,
+ "eval_mean_token_accuracy": 0.849471275196519,
+ "eval_num_tokens": 4289773.0,
+ "eval_runtime": 86.2946,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1840
+ },
+ {
+ "entropy": 0.3051785985007882,
+ "epoch": 4.627646326276463,
+ "grad_norm": 0.8109654188156128,
+ "learning_rate": 0.0001471849238862319,
+ "loss": 0.23433220386505127,
+ "mean_token_accuracy": 0.9206570319831371,
+ "num_tokens": 4336894.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.627646326276463,
+ "eval_entropy": 0.37162452295076015,
+ "eval_loss": 0.6184061765670776,
+ "eval_mean_token_accuracy": 0.8501173268223918,
+ "eval_num_tokens": 4336894.0,
+ "eval_runtime": 86.6865,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1860
+ },
+ {
+ "entropy": 0.3168198253959417,
+ "epoch": 4.677459526774595,
+ "grad_norm": 0.9512342214584351,
+ "learning_rate": 0.0001453061146267775,
+ "loss": 0.23832404613494873,
+ "mean_token_accuracy": 0.9197044663131237,
+ "num_tokens": 4382947.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.677459526774595,
+ "eval_entropy": 0.3845940856912801,
+ "eval_loss": 0.606762707233429,
+ "eval_mean_token_accuracy": 0.8504838194957999,
+ "eval_num_tokens": 4382947.0,
+ "eval_runtime": 86.5175,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 1880
+ },
+ {
+ "entropy": 0.30791807882487776,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 0.8123113512992859,
+ "learning_rate": 0.00014341760442398248,
+ "loss": 0.2395785331726074,
+ "mean_token_accuracy": 0.918928150832653,
+ "num_tokens": 4433050.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.7272727272727275,
+ "eval_entropy": 0.39762327222283494,
+ "eval_loss": 0.5994202494621277,
+ "eval_mean_token_accuracy": 0.8509274201337681,
+ "eval_num_tokens": 4433050.0,
+ "eval_runtime": 86.2873,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.993,
+ "step": 1900
+ },
+ {
+ "entropy": 0.3021434534341097,
+ "epoch": 4.777085927770859,
+ "grad_norm": 0.731787383556366,
+ "learning_rate": 0.000141519962826766,
+ "loss": 0.23494718074798585,
+ "mean_token_accuracy": 0.9201403826475143,
+ "num_tokens": 4483598.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.777085927770859,
+ "eval_entropy": 0.3827026732439219,
+ "eval_loss": 0.5995895862579346,
+ "eval_mean_token_accuracy": 0.851468373523202,
+ "eval_num_tokens": 4483598.0,
+ "eval_runtime": 86.3006,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 1920
+ },
+ {
+ "entropy": 0.31626159623265265,
+ "epoch": 4.826899128268991,
+ "grad_norm": 0.8848487138748169,
+ "learning_rate": 0.00013961376213795132,
+ "loss": 0.2439030647277832,
+ "mean_token_accuracy": 0.9196575872600079,
+ "num_tokens": 4529201.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.826899128268991,
+ "eval_entropy": 0.388698436839636,
+ "eval_loss": 0.6000174283981323,
+ "eval_mean_token_accuracy": 0.8518068187458571,
+ "eval_num_tokens": 4529201.0,
+ "eval_runtime": 86.8979,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.979,
+ "step": 1940
+ },
+ {
+ "entropy": 0.30520407035946845,
+ "epoch": 4.876712328767123,
+ "grad_norm": 0.8532460927963257,
+ "learning_rate": 0.00013769957724166695,
+ "loss": 0.23458616733551024,
+ "mean_token_accuracy": 0.9221912942826748,
+ "num_tokens": 4578167.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.876712328767123,
+ "eval_entropy": 0.38777847102908203,
+ "eval_loss": 0.6004981398582458,
+ "eval_mean_token_accuracy": 0.8516481768253238,
+ "eval_num_tokens": 4578167.0,
+ "eval_runtime": 87.0777,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.975,
+ "step": 1960
+ },
+ {
+ "entropy": 0.3226448342204094,
+ "epoch": 4.926525529265255,
+ "grad_norm": 0.6945561766624451,
+ "learning_rate": 0.0001357779854299694,
+ "loss": 0.24048397541046143,
+ "mean_token_accuracy": 0.9195300146937371,
+ "num_tokens": 4622316.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.926525529265255,
+ "eval_entropy": 0.38581624263247777,
+ "eval_loss": 0.6029234528541565,
+ "eval_mean_token_accuracy": 0.8514213260523108,
+ "eval_num_tokens": 4622316.0,
+ "eval_runtime": 85.8729,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 1980
+ },
+ {
+ "entropy": 0.3051655298098922,
+ "epoch": 4.976338729763388,
+ "grad_norm": 0.7976452708244324,
+ "learning_rate": 0.00013384956622874001,
+ "loss": 0.23584742546081544,
+ "mean_token_accuracy": 0.9216851457953453,
+ "num_tokens": 4670746.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.976338729763388,
+ "eval_entropy": 0.37913159246361533,
+ "eval_loss": 0.6057604551315308,
+ "eval_mean_token_accuracy": 0.8525801203971686,
+ "eval_num_tokens": 4670746.0,
+ "eval_runtime": 86.1145,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2000
+ },
+ {
+ "entropy": 0.27438195240803254,
+ "epoch": 5.024906600249066,
+ "grad_norm": 0.6729586124420166,
+ "learning_rate": 0.0001319149012229075,
+ "loss": 0.19775952100753785,
+ "mean_token_accuracy": 0.9339428559327737,
+ "num_tokens": 4716176.0,
+ "step": 2020
+ },
+ {
+ "epoch": 5.024906600249066,
+ "eval_entropy": 0.3448961910813354,
+ "eval_loss": 0.6750120520591736,
+ "eval_mean_token_accuracy": 0.8487970232963562,
+ "eval_num_tokens": 4716176.0,
+ "eval_runtime": 86.1169,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2020
+ },
+ {
+ "entropy": 0.21423916313797237,
+ "epoch": 5.074719800747198,
+ "grad_norm": 0.6934391856193542,
+ "learning_rate": 0.00012997457388105022,
+ "loss": 0.1439570426940918,
+ "mean_token_accuracy": 0.9528236843645572,
+ "num_tokens": 4763269.0,
+ "step": 2040
+ },
+ {
+ "epoch": 5.074719800747198,
+ "eval_entropy": 0.3570949243771475,
+ "eval_loss": 0.6465504169464111,
+ "eval_mean_token_accuracy": 0.8490785547467166,
+ "eval_num_tokens": 4763269.0,
+ "eval_runtime": 85.9574,
+ "eval_samples_per_second": 15.996,
+ "eval_steps_per_second": 2.001,
+ "step": 2040
+ },
+ {
+ "entropy": 0.20838565267622472,
+ "epoch": 5.12453300124533,
+ "grad_norm": 0.7286986112594604,
+ "learning_rate": 0.00012802916937942972,
+ "loss": 0.14467307329177856,
+ "mean_token_accuracy": 0.950994835793972,
+ "num_tokens": 4809047.0,
+ "step": 2060
+ },
+ {
+ "epoch": 5.12453300124533,
+ "eval_entropy": 0.3452463157821533,
+ "eval_loss": 0.6705958843231201,
+ "eval_mean_token_accuracy": 0.8490352796953778,
+ "eval_num_tokens": 4809047.0,
+ "eval_runtime": 86.228,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 2060
+ },
+ {
+ "entropy": 0.20453082229942082,
+ "epoch": 5.174346201743462,
+ "grad_norm": 0.7515555620193481,
+ "learning_rate": 0.00012607927442550974,
+ "loss": 0.13732000589370727,
+ "mean_token_accuracy": 0.9537357829511166,
+ "num_tokens": 4857965.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.174346201743462,
+ "eval_entropy": 0.32431264914745506,
+ "eval_loss": 0.6743043065071106,
+ "eval_mean_token_accuracy": 0.8504878629085629,
+ "eval_num_tokens": 4857965.0,
+ "eval_runtime": 86.5948,
+ "eval_samples_per_second": 15.879,
+ "eval_steps_per_second": 1.986,
+ "step": 2080
+ },
+ {
+ "entropy": 0.21812320686876774,
+ "epoch": 5.224159402241594,
+ "grad_norm": 0.9093465209007263,
+ "learning_rate": 0.0001241254770810132,
+ "loss": 0.14311420917510986,
+ "mean_token_accuracy": 0.9514068141579628,
+ "num_tokens": 4905151.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.224159402241594,
+ "eval_entropy": 0.33086285835435225,
+ "eval_loss": 0.6676449179649353,
+ "eval_mean_token_accuracy": 0.8505287662495015,
+ "eval_num_tokens": 4905151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 2100
+ },
+ {
+ "entropy": 0.2180163251236081,
+ "epoch": 5.273972602739726,
+ "grad_norm": 0.6703007221221924,
+ "learning_rate": 0.00012216836658457075,
+ "loss": 0.14803968667984008,
+ "mean_token_accuracy": 0.9521303348243236,
+ "num_tokens": 4947072.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.273972602739726,
+ "eval_entropy": 0.33162341708707255,
+ "eval_loss": 0.6658875942230225,
+ "eval_mean_token_accuracy": 0.8500757605530495,
+ "eval_num_tokens": 4947072.0,
+ "eval_runtime": 86.6296,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 2120
+ },
+ {
+ "entropy": 0.22511130161583423,
+ "epoch": 5.323785803237858,
+ "grad_norm": 0.8078880906105042,
+ "learning_rate": 0.00012020853317401455,
+ "loss": 0.15228408575057983,
+ "mean_token_accuracy": 0.947144789993763,
+ "num_tokens": 4991974.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.323785803237858,
+ "eval_entropy": 0.3354601170434508,
+ "eval_loss": 0.6677829623222351,
+ "eval_mean_token_accuracy": 0.8482600024273229,
+ "eval_num_tokens": 4991974.0,
+ "eval_runtime": 86.4689,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.989,
+ "step": 2140
+ },
+ {
+ "entropy": 0.2244176059961319,
+ "epoch": 5.37359900373599,
+ "grad_norm": 0.9636075496673584,
+ "learning_rate": 0.00011824656790837037,
+ "loss": 0.15260883569717407,
+ "mean_token_accuracy": 0.9471467643976211,
+ "num_tokens": 5038400.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.37359900373599,
+ "eval_entropy": 0.3381616926297199,
+ "eval_loss": 0.6694412231445312,
+ "eval_mean_token_accuracy": 0.8482369603805764,
+ "eval_num_tokens": 5038400.0,
+ "eval_runtime": 86.4147,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 2160
+ },
+ {
+ "entropy": 0.22982364390045404,
+ "epoch": 5.423412204234122,
+ "grad_norm": 0.775401771068573,
+ "learning_rate": 0.00011628306248960262,
+ "loss": 0.15140302181243898,
+ "mean_token_accuracy": 0.9492553934454918,
+ "num_tokens": 5083166.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.423412204234122,
+ "eval_entropy": 0.3305150235808173,
+ "eval_loss": 0.6717822551727295,
+ "eval_mean_token_accuracy": 0.8489849723355715,
+ "eval_num_tokens": 5083166.0,
+ "eval_runtime": 86.4728,
+ "eval_samples_per_second": 15.901,
+ "eval_steps_per_second": 1.989,
+ "step": 2180
+ },
+ {
+ "entropy": 0.21448935717344284,
+ "epoch": 5.473225404732254,
+ "grad_norm": 0.6575281023979187,
+ "learning_rate": 0.00011431860908416465,
+ "loss": 0.1452319622039795,
+ "mean_token_accuracy": 0.9505287684500218,
+ "num_tokens": 5135109.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.473225404732254,
+ "eval_entropy": 0.3488145174328671,
+ "eval_loss": 0.6612305641174316,
+ "eval_mean_token_accuracy": 0.8492907808963642,
+ "eval_num_tokens": 5135109.0,
+ "eval_runtime": 86.6927,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 2200
+ },
+ {
+ "entropy": 0.23091202937066554,
+ "epoch": 5.523038605230386,
+ "grad_norm": 0.8909686207771301,
+ "learning_rate": 0.00011235380014440985,
+ "loss": 0.15150139331817628,
+ "mean_token_accuracy": 0.9497875183820724,
+ "num_tokens": 5180138.0,
+ "step": 2220
+ },
+ {
+ "epoch": 5.523038605230386,
+ "eval_entropy": 0.3268539015810157,
+ "eval_loss": 0.6667542457580566,
+ "eval_mean_token_accuracy": 0.8499062903398691,
+ "eval_num_tokens": 5180138.0,
+ "eval_runtime": 86.4644,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 2220
+ },
+ {
+ "entropy": 0.2227974807843566,
+ "epoch": 5.572851805728518,
+ "grad_norm": 0.6180275082588196,
+ "learning_rate": 0.0001103892282299158,
+ "loss": 0.1491069197654724,
+ "mean_token_accuracy": 0.9488144010305405,
+ "num_tokens": 5226864.0,
+ "step": 2240
+ },
+ {
+ "epoch": 5.572851805728518,
+ "eval_entropy": 0.3346347655494546,
+ "eval_loss": 0.6665948629379272,
+ "eval_mean_token_accuracy": 0.8499961893918903,
+ "eval_num_tokens": 5226864.0,
+ "eval_runtime": 87.0548,
+ "eval_samples_per_second": 15.795,
+ "eval_steps_per_second": 1.976,
+ "step": 2240
+ },
+ {
+ "entropy": 0.21368421968072654,
+ "epoch": 5.62266500622665,
+ "grad_norm": 0.6004369258880615,
+ "learning_rate": 0.00010842548582877651,
+ "loss": 0.14485255479812623,
+ "mean_token_accuracy": 0.9502056457102299,
+ "num_tokens": 5276602.0,
+ "step": 2260
+ },
+ {
+ "epoch": 5.62266500622665,
+ "eval_entropy": 0.32753298804163933,
+ "eval_loss": 0.6680151224136353,
+ "eval_mean_token_accuracy": 0.8515451086121936,
+ "eval_num_tokens": 5276602.0,
+ "eval_runtime": 86.8524,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.98,
+ "step": 2260
+ },
+ {
+ "entropy": 0.2103635374456644,
+ "epoch": 5.672478206724782,
+ "grad_norm": 0.699174702167511,
+ "learning_rate": 0.00010646316517891613,
+ "loss": 0.14297772645950318,
+ "mean_token_accuracy": 0.9512537539005279,
+ "num_tokens": 5323718.0,
+ "step": 2280
+ },
+ {
+ "epoch": 5.672478206724782,
+ "eval_entropy": 0.32966585959806,
+ "eval_loss": 0.675578773021698,
+ "eval_mean_token_accuracy": 0.8509623023659684,
+ "eval_num_tokens": 5323718.0,
+ "eval_runtime": 86.4518,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2280
+ },
+ {
+ "entropy": 0.22516900151968003,
+ "epoch": 5.722291407222914,
+ "grad_norm": 0.6637354493141174,
+ "learning_rate": 0.00010450285808947797,
+ "loss": 0.15202572345733642,
+ "mean_token_accuracy": 0.9482452072203159,
+ "num_tokens": 5369039.0,
+ "step": 2300
+ },
+ {
+ "epoch": 5.722291407222914,
+ "eval_entropy": 0.3369456917740578,
+ "eval_loss": 0.6697061061859131,
+ "eval_mean_token_accuracy": 0.848603522361711,
+ "eval_num_tokens": 5369039.0,
+ "eval_runtime": 86.6371,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.985,
+ "step": 2300
+ },
+ {
+ "entropy": 0.21841065725311637,
+ "epoch": 5.772104607721046,
+ "grad_norm": 0.7940268516540527,
+ "learning_rate": 0.00010254515576234297,
+ "loss": 0.14710167646408082,
+ "mean_token_accuracy": 0.9493498183786869,
+ "num_tokens": 5417029.0,
+ "step": 2320
+ },
+ {
+ "epoch": 5.772104607721046,
+ "eval_entropy": 0.3237486180177955,
+ "eval_loss": 0.6779657602310181,
+ "eval_mean_token_accuracy": 0.8500715313955794,
+ "eval_num_tokens": 5417029.0,
+ "eval_runtime": 86.1826,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 1.996,
+ "step": 2320
+ },
+ {
+ "entropy": 0.22146204356104135,
+ "epoch": 5.821917808219178,
+ "grad_norm": 0.9234833121299744,
+ "learning_rate": 0.00010059064861383132,
+ "loss": 0.14720046520233154,
+ "mean_token_accuracy": 0.9493872679769992,
+ "num_tokens": 5461671.0,
+ "step": 2340
+ },
+ {
+ "epoch": 5.821917808219178,
+ "eval_entropy": 0.32365207564692167,
+ "eval_loss": 0.6704005002975464,
+ "eval_mean_token_accuracy": 0.8507985760306203,
+ "eval_num_tokens": 5461671.0,
+ "eval_runtime": 86.5494,
+ "eval_samples_per_second": 15.887,
+ "eval_steps_per_second": 1.987,
+ "step": 2340
+ },
+ {
+ "entropy": 0.20934011954814197,
+ "epoch": 5.87173100871731,
+ "grad_norm": 0.5547503232955933,
+ "learning_rate": 9.863992609664084e-05,
+ "loss": 0.1464867353439331,
+ "mean_token_accuracy": 0.9503875687718392,
+ "num_tokens": 5509312.0,
+ "step": 2360
+ },
+ {
+ "epoch": 5.87173100871731,
+ "eval_entropy": 0.3330401429083458,
+ "eval_loss": 0.6659091114997864,
+ "eval_mean_token_accuracy": 0.8504848906467127,
+ "eval_num_tokens": 5509312.0,
+ "eval_runtime": 86.5855,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 2360
+ },
+ {
+ "entropy": 0.21678635366261007,
+ "epoch": 5.921544209215442,
+ "grad_norm": 0.570612907409668,
+ "learning_rate": 9.669357652207635e-05,
+ "loss": 0.14821385145187377,
+ "mean_token_accuracy": 0.9503940217196941,
+ "num_tokens": 5558196.0,
+ "step": 2380
+ },
+ {
+ "epoch": 5.921544209215442,
+ "eval_entropy": 0.3322022325077722,
+ "eval_loss": 0.6722489595413208,
+ "eval_mean_token_accuracy": 0.8489979422369669,
+ "eval_num_tokens": 5558196.0,
+ "eval_runtime": 86.2986,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 2380
+ },
+ {
+ "entropy": 0.20932920072227718,
+ "epoch": 5.971357409713574,
+ "grad_norm": 0.7879557609558105,
+ "learning_rate": 9.475218688262262e-05,
+ "loss": 0.14675841331481934,
+ "mean_token_accuracy": 0.9507176131010056,
+ "num_tokens": 5605400.0,
+ "step": 2400
+ },
+ {
+ "epoch": 5.971357409713574,
+ "eval_entropy": 0.3199348642902319,
+ "eval_loss": 0.6698136329650879,
+ "eval_mean_token_accuracy": 0.8514142130003419,
+ "eval_num_tokens": 5605400.0,
+ "eval_runtime": 85.8995,
+ "eval_samples_per_second": 16.007,
+ "eval_steps_per_second": 2.002,
+ "step": 2400
+ },
+ {
+ "entropy": 0.21032143919131693,
+ "epoch": 6.019925280199253,
+ "grad_norm": 0.5823076367378235,
+ "learning_rate": 9.281634267491569e-05,
+ "loss": 0.13322267532348633,
+ "mean_token_accuracy": 0.9550939072401096,
+ "num_tokens": 5648968.0,
+ "step": 2420
+ },
+ {
+ "epoch": 6.019925280199253,
+ "eval_entropy": 0.30206270117399303,
+ "eval_loss": 0.7093168497085571,
+ "eval_mean_token_accuracy": 0.8500627639681794,
+ "eval_num_tokens": 5648968.0,
+ "eval_runtime": 85.8128,
+ "eval_samples_per_second": 16.023,
+ "eval_steps_per_second": 2.004,
+ "step": 2420
+ },
+ {
+ "entropy": 0.1534628233872354,
+ "epoch": 6.069738480697385,
+ "grad_norm": 0.710133969783783,
+ "learning_rate": 9.088662772316508e-05,
+ "loss": 0.09078952670097351,
+ "mean_token_accuracy": 0.9678447999060154,
+ "num_tokens": 5697633.0,
+ "step": 2440
+ },
+ {
+ "epoch": 6.069738480697385,
+ "eval_entropy": 0.28208133101809857,
+ "eval_loss": 0.7636417150497437,
+ "eval_mean_token_accuracy": 0.8494061477655588,
+ "eval_num_tokens": 5697633.0,
+ "eval_runtime": 85.9724,
+ "eval_samples_per_second": 15.994,
+ "eval_steps_per_second": 2.001,
+ "step": 2440
+ },
+ {
+ "entropy": 0.16151462448760867,
+ "epoch": 6.119551681195516,
+ "grad_norm": 0.5793812274932861,
+ "learning_rate": 8.896362400308028e-05,
+ "loss": 0.09545697569847107,
+ "mean_token_accuracy": 0.9671573750674725,
+ "num_tokens": 5745090.0,
+ "step": 2460
+ },
+ {
+ "epoch": 6.119551681195516,
+ "eval_entropy": 0.2833245605403601,
+ "eval_loss": 0.7402405738830566,
+ "eval_mean_token_accuracy": 0.8503523728875226,
+ "eval_num_tokens": 5745090.0,
+ "eval_runtime": 85.5461,
+ "eval_samples_per_second": 16.073,
+ "eval_steps_per_second": 2.011,
+ "step": 2460
+ },
+ {
+ "entropy": 0.15203177919611335,
+ "epoch": 6.169364881693649,
+ "grad_norm": 0.4251123368740082,
+ "learning_rate": 8.704791146635483e-05,
+ "loss": 0.09420782327651978,
+ "mean_token_accuracy": 0.9677386932075024,
+ "num_tokens": 5790333.0,
+ "step": 2480
+ },
+ {
+ "epoch": 6.169364881693649,
+ "eval_entropy": 0.28572545962971313,
+ "eval_loss": 0.735416829586029,
+ "eval_mean_token_accuracy": 0.8487084663884584,
+ "eval_num_tokens": 5790333.0,
+ "eval_runtime": 85.4801,
+ "eval_samples_per_second": 16.086,
+ "eval_steps_per_second": 2.012,
+ "step": 2480
+ },
+ {
+ "entropy": 0.15587336672469973,
+ "epoch": 6.219178082191781,
+ "grad_norm": 0.4357028007507324,
+ "learning_rate": 8.514006786576085e-05,
+ "loss": 0.09429320096969604,
+ "mean_token_accuracy": 0.9682952925562859,
+ "num_tokens": 5837321.0,
+ "step": 2500
+ },
+ {
+ "epoch": 6.219178082191781,
+ "eval_entropy": 0.2859006894882335,
+ "eval_loss": 0.7347224950790405,
+ "eval_mean_token_accuracy": 0.8501905518215757,
+ "eval_num_tokens": 5837321.0,
+ "eval_runtime": 85.7578,
+ "eval_samples_per_second": 16.034,
+ "eval_steps_per_second": 2.006,
+ "step": 2500
+ },
+ {
+ "entropy": 0.15765639198943973,
+ "epoch": 6.268991282689913,
+ "grad_norm": 0.47331130504608154,
+ "learning_rate": 8.324066858090663e-05,
+ "loss": 0.09571113586425781,
+ "mean_token_accuracy": 0.9683481335639954,
+ "num_tokens": 5884398.0,
+ "step": 2520
+ },
+ {
+ "epoch": 6.268991282689913,
+ "eval_entropy": 0.29231513846059176,
+ "eval_loss": 0.7392512559890747,
+ "eval_mean_token_accuracy": 0.8486633983462356,
+ "eval_num_tokens": 5884398.0,
+ "eval_runtime": 85.7846,
+ "eval_samples_per_second": 16.029,
+ "eval_steps_per_second": 2.005,
+ "step": 2520
+ },
+ {
+ "entropy": 0.16176860257983208,
+ "epoch": 6.318804483188045,
+ "grad_norm": 0.6142018437385559,
+ "learning_rate": 8.135028644470992e-05,
+ "loss": 0.09486144185066223,
+ "mean_token_accuracy": 0.9682316601276397,
+ "num_tokens": 5929876.0,
+ "step": 2540
+ },
+ {
+ "epoch": 6.318804483188045,
+ "eval_entropy": 0.2851274753379267,
+ "eval_loss": 0.7520816922187805,
+ "eval_mean_token_accuracy": 0.8501113649717597,
+ "eval_num_tokens": 5929876.0,
+ "eval_runtime": 85.9425,
+ "eval_samples_per_second": 15.999,
+ "eval_steps_per_second": 2.001,
+ "step": 2540
+ },
+ {
+ "entropy": 0.15404034564271568,
+ "epoch": 6.3686176836861765,
+ "grad_norm": 0.6051287651062012,
+ "learning_rate": 7.946949157063964e-05,
+ "loss": 0.09280472993850708,
+ "mean_token_accuracy": 0.9684635892510414,
+ "num_tokens": 5978490.0,
+ "step": 2560
+ },
+ {
+ "epoch": 6.3686176836861765,
+ "eval_entropy": 0.28802703563557114,
+ "eval_loss": 0.7439162135124207,
+ "eval_mean_token_accuracy": 0.8499851770872293,
+ "eval_num_tokens": 5978490.0,
+ "eval_runtime": 86.0703,
+ "eval_samples_per_second": 15.975,
+ "eval_steps_per_second": 1.998,
+ "step": 2560
+ },
+ {
+ "entropy": 0.15343588953837753,
+ "epoch": 6.418430884184309,
+ "grad_norm": 0.4823743402957916,
+ "learning_rate": 7.759885118077701e-05,
+ "loss": 0.09000591039657593,
+ "mean_token_accuracy": 0.9699928767979145,
+ "num_tokens": 6025380.0,
+ "step": 2580
+ },
+ {
+ "epoch": 6.418430884184309,
+ "eval_entropy": 0.2795634938533916,
+ "eval_loss": 0.7647850513458252,
+ "eval_mean_token_accuracy": 0.8503464397995971,
+ "eval_num_tokens": 6025380.0,
+ "eval_runtime": 85.8886,
+ "eval_samples_per_second": 16.009,
+ "eval_steps_per_second": 2.003,
+ "step": 2580
+ },
+ {
+ "entropy": 0.15740026142448188,
+ "epoch": 6.468244084682441,
+ "grad_norm": 0.5082696676254272,
+ "learning_rate": 7.57389294347494e-05,
+ "loss": 0.09191849827766418,
+ "mean_token_accuracy": 0.9692809768021107,
+ "num_tokens": 6073349.0,
+ "step": 2600
+ },
+ {
+ "epoch": 6.468244084682441,
+ "eval_entropy": 0.2913342311458532,
+ "eval_loss": 0.7518694996833801,
+ "eval_mean_token_accuracy": 0.8483168302580367,
+ "eval_num_tokens": 6073349.0,
+ "eval_runtime": 85.5761,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.01,
+ "step": 2600
+ },
+ {
+ "entropy": 0.15922069251537324,
+ "epoch": 6.518057285180573,
+ "grad_norm": 0.3995199501514435,
+ "learning_rate": 7.389028725958736e-05,
+ "loss": 0.09584367871284485,
+ "mean_token_accuracy": 0.9685114495456218,
+ "num_tokens": 6118148.0,
+ "step": 2620
+ },
+ {
+ "epoch": 6.518057285180573,
+ "eval_entropy": 0.2863075934177221,
+ "eval_loss": 0.7539381384849548,
+ "eval_mean_token_accuracy": 0.8507507083027862,
+ "eval_num_tokens": 6118148.0,
+ "eval_runtime": 86.112,
+ "eval_samples_per_second": 15.968,
+ "eval_steps_per_second": 1.997,
+ "step": 2620
+ },
+ {
+ "entropy": 0.16197575423866512,
+ "epoch": 6.567870485678705,
+ "grad_norm": 0.534295380115509,
+ "learning_rate": 7.205348218055678e-05,
+ "loss": 0.0961170256137848,
+ "mean_token_accuracy": 0.9674530044198036,
+ "num_tokens": 6165523.0,
+ "step": 2640
+ },
+ {
+ "epoch": 6.567870485678705,
+ "eval_entropy": 0.29021967315050057,
+ "eval_loss": 0.751198947429657,
+ "eval_mean_token_accuracy": 0.8509796344956686,
+ "eval_num_tokens": 6165523.0,
+ "eval_runtime": 85.7958,
+ "eval_samples_per_second": 16.026,
+ "eval_steps_per_second": 2.005,
+ "step": 2640
+ },
+ {
+ "entropy": 0.15261746793985367,
+ "epoch": 6.617683686176837,
+ "grad_norm": 0.5391237139701843,
+ "learning_rate": 7.022906815301673e-05,
+ "loss": 0.0926026999950409,
+ "mean_token_accuracy": 0.9695659473538398,
+ "num_tokens": 6216232.0,
+ "step": 2660
+ },
+ {
+ "epoch": 6.617683686176837,
+ "eval_entropy": 0.29128045216202736,
+ "eval_loss": 0.7450292110443115,
+ "eval_mean_token_accuracy": 0.8498771443616512,
+ "eval_num_tokens": 6216232.0,
+ "eval_runtime": 86.3963,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 2660
+ },
+ {
+ "entropy": 0.16164180357009172,
+ "epoch": 6.667496886674969,
+ "grad_norm": 0.5767946243286133,
+ "learning_rate": 6.841759539535419e-05,
+ "loss": 0.09291981458663941,
+ "mean_token_accuracy": 0.9687136687338352,
+ "num_tokens": 6264807.0,
+ "step": 2680
+ },
+ {
+ "epoch": 6.667496886674969,
+ "eval_entropy": 0.2897637223088464,
+ "eval_loss": 0.7503410577774048,
+ "eval_mean_token_accuracy": 0.8503315164599308,
+ "eval_num_tokens": 6264807.0,
+ "eval_runtime": 86.0653,
+ "eval_samples_per_second": 15.976,
+ "eval_steps_per_second": 1.998,
+ "step": 2680
+ },
+ {
+ "entropy": 0.17062523355707526,
+ "epoch": 6.717310087173101,
+ "grad_norm": 0.4974168539047241,
+ "learning_rate": 6.661961022304563e-05,
+ "loss": 0.09713236689567566,
+ "mean_token_accuracy": 0.9661971725523472,
+ "num_tokens": 6308819.0,
+ "step": 2700
+ },
+ {
+ "epoch": 6.717310087173101,
+ "eval_entropy": 0.2765843396963075,
+ "eval_loss": 0.7604002356529236,
+ "eval_mean_token_accuracy": 0.8521115277395692,
+ "eval_num_tokens": 6308819.0,
+ "eval_runtime": 86.1676,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 2700
+ },
+ {
+ "entropy": 0.17544092936441302,
+ "epoch": 6.767123287671232,
+ "grad_norm": 0.5523537993431091,
+ "learning_rate": 6.483565488389582e-05,
+ "loss": 0.09709116220474243,
+ "mean_token_accuracy": 0.9650957375764847,
+ "num_tokens": 6352548.0,
+ "step": 2720
+ },
+ {
+ "epoch": 6.767123287671232,
+ "eval_entropy": 0.27939334659035814,
+ "eval_loss": 0.7534670829772949,
+ "eval_mean_token_accuracy": 0.851230604010959,
+ "eval_num_tokens": 6352548.0,
+ "eval_runtime": 86.2913,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 2720
+ },
+ {
+ "entropy": 0.15991022661328316,
+ "epoch": 6.816936488169365,
+ "grad_norm": 0.478551983833313,
+ "learning_rate": 6.306626739450311e-05,
+ "loss": 0.09564646482467651,
+ "mean_token_accuracy": 0.9679084822535515,
+ "num_tokens": 6397720.0,
+ "step": 2740
+ },
+ {
+ "epoch": 6.816936488169365,
+ "eval_entropy": 0.27878295491601146,
+ "eval_loss": 0.7519959211349487,
+ "eval_mean_token_accuracy": 0.8510654949864676,
+ "eval_num_tokens": 6397720.0,
+ "eval_runtime": 85.9109,
+ "eval_samples_per_second": 16.005,
+ "eval_steps_per_second": 2.002,
+ "step": 2740
+ },
+ {
+ "entropy": 0.16824879590421915,
+ "epoch": 6.866749688667497,
+ "grad_norm": 0.6681098937988281,
+ "learning_rate": 6.131198137800108e-05,
+ "loss": 0.0962279736995697,
+ "mean_token_accuracy": 0.966830012947321,
+ "num_tokens": 6442821.0,
+ "step": 2760
+ },
+ {
+ "epoch": 6.866749688667497,
+ "eval_entropy": 0.2834690434121808,
+ "eval_loss": 0.751922070980072,
+ "eval_mean_token_accuracy": 0.8521237577809844,
+ "eval_num_tokens": 6442821.0,
+ "eval_runtime": 86.3618,
+ "eval_samples_per_second": 15.921,
+ "eval_steps_per_second": 1.992,
+ "step": 2760
+ },
+ {
+ "entropy": 0.1518704930320382,
+ "epoch": 6.916562889165629,
+ "grad_norm": 0.5201290249824524,
+ "learning_rate": 5.957332590312513e-05,
+ "loss": 0.09010660648345947,
+ "mean_token_accuracy": 0.9693463340401649,
+ "num_tokens": 6494118.0,
+ "step": 2780
+ },
+ {
+ "epoch": 6.916562889165629,
+ "eval_entropy": 0.28485129617674404,
+ "eval_loss": 0.7452457547187805,
+ "eval_mean_token_accuracy": 0.8512036796919135,
+ "eval_num_tokens": 6494118.0,
+ "eval_runtime": 86.4524,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2780
+ },
+ {
+ "entropy": 0.15512610590085388,
+ "epoch": 6.966376089663761,
+ "grad_norm": 0.42802050709724426,
+ "learning_rate": 5.785082532465233e-05,
+ "loss": 0.09320432543754578,
+ "mean_token_accuracy": 0.9686134628951549,
+ "num_tokens": 6540175.0,
+ "step": 2800
+ },
+ {
+ "epoch": 6.966376089663761,
+ "eval_entropy": 0.27554594526110693,
+ "eval_loss": 0.7644653916358948,
+ "eval_mean_token_accuracy": 0.8513738523389018,
+ "eval_num_tokens": 6540175.0,
+ "eval_runtime": 85.7609,
+ "eval_samples_per_second": 16.033,
+ "eval_steps_per_second": 2.006,
+ "step": 2800
+ },
+ {
+ "entropy": 0.17524497526196334,
+ "epoch": 7.01494396014944,
+ "grad_norm": 0.3330269157886505,
+ "learning_rate": 5.6144999125263545e-05,
+ "loss": 0.0895616888999939,
+ "mean_token_accuracy": 0.9682766932707566,
+ "num_tokens": 6583767.0,
+ "step": 2820
+ },
+ {
+ "epoch": 7.01494396014944,
+ "eval_entropy": 0.2735865569218647,
+ "eval_loss": 0.768479585647583,
+ "eval_mean_token_accuracy": 0.8503459383581959,
+ "eval_num_tokens": 6583767.0,
+ "eval_runtime": 85.7162,
+ "eval_samples_per_second": 16.041,
+ "eval_steps_per_second": 2.007,
+ "step": 2820
+ },
+ {
+ "entropy": 0.1403565663844347,
+ "epoch": 7.064757160647572,
+ "grad_norm": 0.35613498091697693,
+ "learning_rate": 5.4456361758874235e-05,
+ "loss": 0.07551313638687134,
+ "mean_token_accuracy": 0.9739301167428493,
+ "num_tokens": 6627672.0,
+ "step": 2840
+ },
+ {
+ "epoch": 7.064757160647572,
+ "eval_entropy": 0.25941789089593775,
+ "eval_loss": 0.8209511637687683,
+ "eval_mean_token_accuracy": 0.8505055855873019,
+ "eval_num_tokens": 6627672.0,
+ "eval_runtime": 86.0943,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 2840
+ },
+ {
+ "entropy": 0.13500106502324344,
+ "epoch": 7.114570361145703,
+ "grad_norm": 0.34418627619743347,
+ "learning_rate": 5.2785422495482234e-05,
+ "loss": 0.07293946146965027,
+ "mean_token_accuracy": 0.9747208289802074,
+ "num_tokens": 6672946.0,
+ "step": 2860
+ },
+ {
+ "epoch": 7.114570361145703,
+ "eval_entropy": 0.26482899772912954,
+ "eval_loss": 0.798904538154602,
+ "eval_mean_token_accuracy": 0.8511530233677044,
+ "eval_num_tokens": 6672946.0,
+ "eval_runtime": 85.7915,
+ "eval_samples_per_second": 16.027,
+ "eval_steps_per_second": 2.005,
+ "step": 2860
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.8143420964432896e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2880/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2880/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2880/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2880/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2880/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2880/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2880/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2880/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2880/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2880/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2880/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2880/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2880/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2880/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..51bbcfab2db6aa1ee043adc0d245748ad4a782cf
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2880/trainer_state.json
@@ -0,0 +1,3058 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 7.164383561643835,
+ "eval_steps": 20,
+ "global_step": 2880,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ },
+ {
+ "entropy": 0.3193941755220294,
+ "epoch": 4.5280199252802,
+ "grad_norm": 0.8281906843185425,
+ "learning_rate": 0.0001509111761786888,
+ "loss": 0.23936262130737304,
+ "mean_token_accuracy": 0.9201708927750587,
+ "num_tokens": 4244423.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.5280199252802,
+ "eval_entropy": 0.38704028864239537,
+ "eval_loss": 0.6006569266319275,
+ "eval_mean_token_accuracy": 0.8502406720505205,
+ "eval_num_tokens": 4244423.0,
+ "eval_runtime": 86.8059,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1820
+ },
+ {
+ "entropy": 0.3164879363030195,
+ "epoch": 4.577833125778331,
+ "grad_norm": 0.7892968654632568,
+ "learning_rate": 0.00014905346557909867,
+ "loss": 0.24541733264923096,
+ "mean_token_accuracy": 0.9175932116806507,
+ "num_tokens": 4289773.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.577833125778331,
+ "eval_entropy": 0.38861122120951497,
+ "eval_loss": 0.6115967631340027,
+ "eval_mean_token_accuracy": 0.849471275196519,
+ "eval_num_tokens": 4289773.0,
+ "eval_runtime": 86.2946,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1840
+ },
+ {
+ "entropy": 0.3051785985007882,
+ "epoch": 4.627646326276463,
+ "grad_norm": 0.8109654188156128,
+ "learning_rate": 0.0001471849238862319,
+ "loss": 0.23433220386505127,
+ "mean_token_accuracy": 0.9206570319831371,
+ "num_tokens": 4336894.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.627646326276463,
+ "eval_entropy": 0.37162452295076015,
+ "eval_loss": 0.6184061765670776,
+ "eval_mean_token_accuracy": 0.8501173268223918,
+ "eval_num_tokens": 4336894.0,
+ "eval_runtime": 86.6865,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1860
+ },
+ {
+ "entropy": 0.3168198253959417,
+ "epoch": 4.677459526774595,
+ "grad_norm": 0.9512342214584351,
+ "learning_rate": 0.0001453061146267775,
+ "loss": 0.23832404613494873,
+ "mean_token_accuracy": 0.9197044663131237,
+ "num_tokens": 4382947.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.677459526774595,
+ "eval_entropy": 0.3845940856912801,
+ "eval_loss": 0.606762707233429,
+ "eval_mean_token_accuracy": 0.8504838194957999,
+ "eval_num_tokens": 4382947.0,
+ "eval_runtime": 86.5175,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 1880
+ },
+ {
+ "entropy": 0.30791807882487776,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 0.8123113512992859,
+ "learning_rate": 0.00014341760442398248,
+ "loss": 0.2395785331726074,
+ "mean_token_accuracy": 0.918928150832653,
+ "num_tokens": 4433050.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.7272727272727275,
+ "eval_entropy": 0.39762327222283494,
+ "eval_loss": 0.5994202494621277,
+ "eval_mean_token_accuracy": 0.8509274201337681,
+ "eval_num_tokens": 4433050.0,
+ "eval_runtime": 86.2873,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.993,
+ "step": 1900
+ },
+ {
+ "entropy": 0.3021434534341097,
+ "epoch": 4.777085927770859,
+ "grad_norm": 0.731787383556366,
+ "learning_rate": 0.000141519962826766,
+ "loss": 0.23494718074798585,
+ "mean_token_accuracy": 0.9201403826475143,
+ "num_tokens": 4483598.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.777085927770859,
+ "eval_entropy": 0.3827026732439219,
+ "eval_loss": 0.5995895862579346,
+ "eval_mean_token_accuracy": 0.851468373523202,
+ "eval_num_tokens": 4483598.0,
+ "eval_runtime": 86.3006,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 1920
+ },
+ {
+ "entropy": 0.31626159623265265,
+ "epoch": 4.826899128268991,
+ "grad_norm": 0.8848487138748169,
+ "learning_rate": 0.00013961376213795132,
+ "loss": 0.2439030647277832,
+ "mean_token_accuracy": 0.9196575872600079,
+ "num_tokens": 4529201.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.826899128268991,
+ "eval_entropy": 0.388698436839636,
+ "eval_loss": 0.6000174283981323,
+ "eval_mean_token_accuracy": 0.8518068187458571,
+ "eval_num_tokens": 4529201.0,
+ "eval_runtime": 86.8979,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.979,
+ "step": 1940
+ },
+ {
+ "entropy": 0.30520407035946845,
+ "epoch": 4.876712328767123,
+ "grad_norm": 0.8532460927963257,
+ "learning_rate": 0.00013769957724166695,
+ "loss": 0.23458616733551024,
+ "mean_token_accuracy": 0.9221912942826748,
+ "num_tokens": 4578167.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.876712328767123,
+ "eval_entropy": 0.38777847102908203,
+ "eval_loss": 0.6004981398582458,
+ "eval_mean_token_accuracy": 0.8516481768253238,
+ "eval_num_tokens": 4578167.0,
+ "eval_runtime": 87.0777,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.975,
+ "step": 1960
+ },
+ {
+ "entropy": 0.3226448342204094,
+ "epoch": 4.926525529265255,
+ "grad_norm": 0.6945561766624451,
+ "learning_rate": 0.0001357779854299694,
+ "loss": 0.24048397541046143,
+ "mean_token_accuracy": 0.9195300146937371,
+ "num_tokens": 4622316.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.926525529265255,
+ "eval_entropy": 0.38581624263247777,
+ "eval_loss": 0.6029234528541565,
+ "eval_mean_token_accuracy": 0.8514213260523108,
+ "eval_num_tokens": 4622316.0,
+ "eval_runtime": 85.8729,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 1980
+ },
+ {
+ "entropy": 0.3051655298098922,
+ "epoch": 4.976338729763388,
+ "grad_norm": 0.7976452708244324,
+ "learning_rate": 0.00013384956622874001,
+ "loss": 0.23584742546081544,
+ "mean_token_accuracy": 0.9216851457953453,
+ "num_tokens": 4670746.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.976338729763388,
+ "eval_entropy": 0.37913159246361533,
+ "eval_loss": 0.6057604551315308,
+ "eval_mean_token_accuracy": 0.8525801203971686,
+ "eval_num_tokens": 4670746.0,
+ "eval_runtime": 86.1145,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2000
+ },
+ {
+ "entropy": 0.27438195240803254,
+ "epoch": 5.024906600249066,
+ "grad_norm": 0.6729586124420166,
+ "learning_rate": 0.0001319149012229075,
+ "loss": 0.19775952100753785,
+ "mean_token_accuracy": 0.9339428559327737,
+ "num_tokens": 4716176.0,
+ "step": 2020
+ },
+ {
+ "epoch": 5.024906600249066,
+ "eval_entropy": 0.3448961910813354,
+ "eval_loss": 0.6750120520591736,
+ "eval_mean_token_accuracy": 0.8487970232963562,
+ "eval_num_tokens": 4716176.0,
+ "eval_runtime": 86.1169,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2020
+ },
+ {
+ "entropy": 0.21423916313797237,
+ "epoch": 5.074719800747198,
+ "grad_norm": 0.6934391856193542,
+ "learning_rate": 0.00012997457388105022,
+ "loss": 0.1439570426940918,
+ "mean_token_accuracy": 0.9528236843645572,
+ "num_tokens": 4763269.0,
+ "step": 2040
+ },
+ {
+ "epoch": 5.074719800747198,
+ "eval_entropy": 0.3570949243771475,
+ "eval_loss": 0.6465504169464111,
+ "eval_mean_token_accuracy": 0.8490785547467166,
+ "eval_num_tokens": 4763269.0,
+ "eval_runtime": 85.9574,
+ "eval_samples_per_second": 15.996,
+ "eval_steps_per_second": 2.001,
+ "step": 2040
+ },
+ {
+ "entropy": 0.20838565267622472,
+ "epoch": 5.12453300124533,
+ "grad_norm": 0.7286986112594604,
+ "learning_rate": 0.00012802916937942972,
+ "loss": 0.14467307329177856,
+ "mean_token_accuracy": 0.950994835793972,
+ "num_tokens": 4809047.0,
+ "step": 2060
+ },
+ {
+ "epoch": 5.12453300124533,
+ "eval_entropy": 0.3452463157821533,
+ "eval_loss": 0.6705958843231201,
+ "eval_mean_token_accuracy": 0.8490352796953778,
+ "eval_num_tokens": 4809047.0,
+ "eval_runtime": 86.228,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 2060
+ },
+ {
+ "entropy": 0.20453082229942082,
+ "epoch": 5.174346201743462,
+ "grad_norm": 0.7515555620193481,
+ "learning_rate": 0.00012607927442550974,
+ "loss": 0.13732000589370727,
+ "mean_token_accuracy": 0.9537357829511166,
+ "num_tokens": 4857965.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.174346201743462,
+ "eval_entropy": 0.32431264914745506,
+ "eval_loss": 0.6743043065071106,
+ "eval_mean_token_accuracy": 0.8504878629085629,
+ "eval_num_tokens": 4857965.0,
+ "eval_runtime": 86.5948,
+ "eval_samples_per_second": 15.879,
+ "eval_steps_per_second": 1.986,
+ "step": 2080
+ },
+ {
+ "entropy": 0.21812320686876774,
+ "epoch": 5.224159402241594,
+ "grad_norm": 0.9093465209007263,
+ "learning_rate": 0.0001241254770810132,
+ "loss": 0.14311420917510986,
+ "mean_token_accuracy": 0.9514068141579628,
+ "num_tokens": 4905151.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.224159402241594,
+ "eval_entropy": 0.33086285835435225,
+ "eval_loss": 0.6676449179649353,
+ "eval_mean_token_accuracy": 0.8505287662495015,
+ "eval_num_tokens": 4905151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 2100
+ },
+ {
+ "entropy": 0.2180163251236081,
+ "epoch": 5.273972602739726,
+ "grad_norm": 0.6703007221221924,
+ "learning_rate": 0.00012216836658457075,
+ "loss": 0.14803968667984008,
+ "mean_token_accuracy": 0.9521303348243236,
+ "num_tokens": 4947072.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.273972602739726,
+ "eval_entropy": 0.33162341708707255,
+ "eval_loss": 0.6658875942230225,
+ "eval_mean_token_accuracy": 0.8500757605530495,
+ "eval_num_tokens": 4947072.0,
+ "eval_runtime": 86.6296,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 2120
+ },
+ {
+ "entropy": 0.22511130161583423,
+ "epoch": 5.323785803237858,
+ "grad_norm": 0.8078880906105042,
+ "learning_rate": 0.00012020853317401455,
+ "loss": 0.15228408575057983,
+ "mean_token_accuracy": 0.947144789993763,
+ "num_tokens": 4991974.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.323785803237858,
+ "eval_entropy": 0.3354601170434508,
+ "eval_loss": 0.6677829623222351,
+ "eval_mean_token_accuracy": 0.8482600024273229,
+ "eval_num_tokens": 4991974.0,
+ "eval_runtime": 86.4689,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.989,
+ "step": 2140
+ },
+ {
+ "entropy": 0.2244176059961319,
+ "epoch": 5.37359900373599,
+ "grad_norm": 0.9636075496673584,
+ "learning_rate": 0.00011824656790837037,
+ "loss": 0.15260883569717407,
+ "mean_token_accuracy": 0.9471467643976211,
+ "num_tokens": 5038400.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.37359900373599,
+ "eval_entropy": 0.3381616926297199,
+ "eval_loss": 0.6694412231445312,
+ "eval_mean_token_accuracy": 0.8482369603805764,
+ "eval_num_tokens": 5038400.0,
+ "eval_runtime": 86.4147,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 2160
+ },
+ {
+ "entropy": 0.22982364390045404,
+ "epoch": 5.423412204234122,
+ "grad_norm": 0.775401771068573,
+ "learning_rate": 0.00011628306248960262,
+ "loss": 0.15140302181243898,
+ "mean_token_accuracy": 0.9492553934454918,
+ "num_tokens": 5083166.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.423412204234122,
+ "eval_entropy": 0.3305150235808173,
+ "eval_loss": 0.6717822551727295,
+ "eval_mean_token_accuracy": 0.8489849723355715,
+ "eval_num_tokens": 5083166.0,
+ "eval_runtime": 86.4728,
+ "eval_samples_per_second": 15.901,
+ "eval_steps_per_second": 1.989,
+ "step": 2180
+ },
+ {
+ "entropy": 0.21448935717344284,
+ "epoch": 5.473225404732254,
+ "grad_norm": 0.6575281023979187,
+ "learning_rate": 0.00011431860908416465,
+ "loss": 0.1452319622039795,
+ "mean_token_accuracy": 0.9505287684500218,
+ "num_tokens": 5135109.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.473225404732254,
+ "eval_entropy": 0.3488145174328671,
+ "eval_loss": 0.6612305641174316,
+ "eval_mean_token_accuracy": 0.8492907808963642,
+ "eval_num_tokens": 5135109.0,
+ "eval_runtime": 86.6927,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 2200
+ },
+ {
+ "entropy": 0.23091202937066554,
+ "epoch": 5.523038605230386,
+ "grad_norm": 0.8909686207771301,
+ "learning_rate": 0.00011235380014440985,
+ "loss": 0.15150139331817628,
+ "mean_token_accuracy": 0.9497875183820724,
+ "num_tokens": 5180138.0,
+ "step": 2220
+ },
+ {
+ "epoch": 5.523038605230386,
+ "eval_entropy": 0.3268539015810157,
+ "eval_loss": 0.6667542457580566,
+ "eval_mean_token_accuracy": 0.8499062903398691,
+ "eval_num_tokens": 5180138.0,
+ "eval_runtime": 86.4644,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 2220
+ },
+ {
+ "entropy": 0.2227974807843566,
+ "epoch": 5.572851805728518,
+ "grad_norm": 0.6180275082588196,
+ "learning_rate": 0.0001103892282299158,
+ "loss": 0.1491069197654724,
+ "mean_token_accuracy": 0.9488144010305405,
+ "num_tokens": 5226864.0,
+ "step": 2240
+ },
+ {
+ "epoch": 5.572851805728518,
+ "eval_entropy": 0.3346347655494546,
+ "eval_loss": 0.6665948629379272,
+ "eval_mean_token_accuracy": 0.8499961893918903,
+ "eval_num_tokens": 5226864.0,
+ "eval_runtime": 87.0548,
+ "eval_samples_per_second": 15.795,
+ "eval_steps_per_second": 1.976,
+ "step": 2240
+ },
+ {
+ "entropy": 0.21368421968072654,
+ "epoch": 5.62266500622665,
+ "grad_norm": 0.6004369258880615,
+ "learning_rate": 0.00010842548582877651,
+ "loss": 0.14485255479812623,
+ "mean_token_accuracy": 0.9502056457102299,
+ "num_tokens": 5276602.0,
+ "step": 2260
+ },
+ {
+ "epoch": 5.62266500622665,
+ "eval_entropy": 0.32753298804163933,
+ "eval_loss": 0.6680151224136353,
+ "eval_mean_token_accuracy": 0.8515451086121936,
+ "eval_num_tokens": 5276602.0,
+ "eval_runtime": 86.8524,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.98,
+ "step": 2260
+ },
+ {
+ "entropy": 0.2103635374456644,
+ "epoch": 5.672478206724782,
+ "grad_norm": 0.699174702167511,
+ "learning_rate": 0.00010646316517891613,
+ "loss": 0.14297772645950318,
+ "mean_token_accuracy": 0.9512537539005279,
+ "num_tokens": 5323718.0,
+ "step": 2280
+ },
+ {
+ "epoch": 5.672478206724782,
+ "eval_entropy": 0.32966585959806,
+ "eval_loss": 0.675578773021698,
+ "eval_mean_token_accuracy": 0.8509623023659684,
+ "eval_num_tokens": 5323718.0,
+ "eval_runtime": 86.4518,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2280
+ },
+ {
+ "entropy": 0.22516900151968003,
+ "epoch": 5.722291407222914,
+ "grad_norm": 0.6637354493141174,
+ "learning_rate": 0.00010450285808947797,
+ "loss": 0.15202572345733642,
+ "mean_token_accuracy": 0.9482452072203159,
+ "num_tokens": 5369039.0,
+ "step": 2300
+ },
+ {
+ "epoch": 5.722291407222914,
+ "eval_entropy": 0.3369456917740578,
+ "eval_loss": 0.6697061061859131,
+ "eval_mean_token_accuracy": 0.848603522361711,
+ "eval_num_tokens": 5369039.0,
+ "eval_runtime": 86.6371,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.985,
+ "step": 2300
+ },
+ {
+ "entropy": 0.21841065725311637,
+ "epoch": 5.772104607721046,
+ "grad_norm": 0.7940268516540527,
+ "learning_rate": 0.00010254515576234297,
+ "loss": 0.14710167646408082,
+ "mean_token_accuracy": 0.9493498183786869,
+ "num_tokens": 5417029.0,
+ "step": 2320
+ },
+ {
+ "epoch": 5.772104607721046,
+ "eval_entropy": 0.3237486180177955,
+ "eval_loss": 0.6779657602310181,
+ "eval_mean_token_accuracy": 0.8500715313955794,
+ "eval_num_tokens": 5417029.0,
+ "eval_runtime": 86.1826,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 1.996,
+ "step": 2320
+ },
+ {
+ "entropy": 0.22146204356104135,
+ "epoch": 5.821917808219178,
+ "grad_norm": 0.9234833121299744,
+ "learning_rate": 0.00010059064861383132,
+ "loss": 0.14720046520233154,
+ "mean_token_accuracy": 0.9493872679769992,
+ "num_tokens": 5461671.0,
+ "step": 2340
+ },
+ {
+ "epoch": 5.821917808219178,
+ "eval_entropy": 0.32365207564692167,
+ "eval_loss": 0.6704005002975464,
+ "eval_mean_token_accuracy": 0.8507985760306203,
+ "eval_num_tokens": 5461671.0,
+ "eval_runtime": 86.5494,
+ "eval_samples_per_second": 15.887,
+ "eval_steps_per_second": 1.987,
+ "step": 2340
+ },
+ {
+ "entropy": 0.20934011954814197,
+ "epoch": 5.87173100871731,
+ "grad_norm": 0.5547503232955933,
+ "learning_rate": 9.863992609664084e-05,
+ "loss": 0.1464867353439331,
+ "mean_token_accuracy": 0.9503875687718392,
+ "num_tokens": 5509312.0,
+ "step": 2360
+ },
+ {
+ "epoch": 5.87173100871731,
+ "eval_entropy": 0.3330401429083458,
+ "eval_loss": 0.6659091114997864,
+ "eval_mean_token_accuracy": 0.8504848906467127,
+ "eval_num_tokens": 5509312.0,
+ "eval_runtime": 86.5855,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 2360
+ },
+ {
+ "entropy": 0.21678635366261007,
+ "epoch": 5.921544209215442,
+ "grad_norm": 0.570612907409668,
+ "learning_rate": 9.669357652207635e-05,
+ "loss": 0.14821385145187377,
+ "mean_token_accuracy": 0.9503940217196941,
+ "num_tokens": 5558196.0,
+ "step": 2380
+ },
+ {
+ "epoch": 5.921544209215442,
+ "eval_entropy": 0.3322022325077722,
+ "eval_loss": 0.6722489595413208,
+ "eval_mean_token_accuracy": 0.8489979422369669,
+ "eval_num_tokens": 5558196.0,
+ "eval_runtime": 86.2986,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 2380
+ },
+ {
+ "entropy": 0.20932920072227718,
+ "epoch": 5.971357409713574,
+ "grad_norm": 0.7879557609558105,
+ "learning_rate": 9.475218688262262e-05,
+ "loss": 0.14675841331481934,
+ "mean_token_accuracy": 0.9507176131010056,
+ "num_tokens": 5605400.0,
+ "step": 2400
+ },
+ {
+ "epoch": 5.971357409713574,
+ "eval_entropy": 0.3199348642902319,
+ "eval_loss": 0.6698136329650879,
+ "eval_mean_token_accuracy": 0.8514142130003419,
+ "eval_num_tokens": 5605400.0,
+ "eval_runtime": 85.8995,
+ "eval_samples_per_second": 16.007,
+ "eval_steps_per_second": 2.002,
+ "step": 2400
+ },
+ {
+ "entropy": 0.21032143919131693,
+ "epoch": 6.019925280199253,
+ "grad_norm": 0.5823076367378235,
+ "learning_rate": 9.281634267491569e-05,
+ "loss": 0.13322267532348633,
+ "mean_token_accuracy": 0.9550939072401096,
+ "num_tokens": 5648968.0,
+ "step": 2420
+ },
+ {
+ "epoch": 6.019925280199253,
+ "eval_entropy": 0.30206270117399303,
+ "eval_loss": 0.7093168497085571,
+ "eval_mean_token_accuracy": 0.8500627639681794,
+ "eval_num_tokens": 5648968.0,
+ "eval_runtime": 85.8128,
+ "eval_samples_per_second": 16.023,
+ "eval_steps_per_second": 2.004,
+ "step": 2420
+ },
+ {
+ "entropy": 0.1534628233872354,
+ "epoch": 6.069738480697385,
+ "grad_norm": 0.710133969783783,
+ "learning_rate": 9.088662772316508e-05,
+ "loss": 0.09078952670097351,
+ "mean_token_accuracy": 0.9678447999060154,
+ "num_tokens": 5697633.0,
+ "step": 2440
+ },
+ {
+ "epoch": 6.069738480697385,
+ "eval_entropy": 0.28208133101809857,
+ "eval_loss": 0.7636417150497437,
+ "eval_mean_token_accuracy": 0.8494061477655588,
+ "eval_num_tokens": 5697633.0,
+ "eval_runtime": 85.9724,
+ "eval_samples_per_second": 15.994,
+ "eval_steps_per_second": 2.001,
+ "step": 2440
+ },
+ {
+ "entropy": 0.16151462448760867,
+ "epoch": 6.119551681195516,
+ "grad_norm": 0.5793812274932861,
+ "learning_rate": 8.896362400308028e-05,
+ "loss": 0.09545697569847107,
+ "mean_token_accuracy": 0.9671573750674725,
+ "num_tokens": 5745090.0,
+ "step": 2460
+ },
+ {
+ "epoch": 6.119551681195516,
+ "eval_entropy": 0.2833245605403601,
+ "eval_loss": 0.7402405738830566,
+ "eval_mean_token_accuracy": 0.8503523728875226,
+ "eval_num_tokens": 5745090.0,
+ "eval_runtime": 85.5461,
+ "eval_samples_per_second": 16.073,
+ "eval_steps_per_second": 2.011,
+ "step": 2460
+ },
+ {
+ "entropy": 0.15203177919611335,
+ "epoch": 6.169364881693649,
+ "grad_norm": 0.4251123368740082,
+ "learning_rate": 8.704791146635483e-05,
+ "loss": 0.09420782327651978,
+ "mean_token_accuracy": 0.9677386932075024,
+ "num_tokens": 5790333.0,
+ "step": 2480
+ },
+ {
+ "epoch": 6.169364881693649,
+ "eval_entropy": 0.28572545962971313,
+ "eval_loss": 0.735416829586029,
+ "eval_mean_token_accuracy": 0.8487084663884584,
+ "eval_num_tokens": 5790333.0,
+ "eval_runtime": 85.4801,
+ "eval_samples_per_second": 16.086,
+ "eval_steps_per_second": 2.012,
+ "step": 2480
+ },
+ {
+ "entropy": 0.15587336672469973,
+ "epoch": 6.219178082191781,
+ "grad_norm": 0.4357028007507324,
+ "learning_rate": 8.514006786576085e-05,
+ "loss": 0.09429320096969604,
+ "mean_token_accuracy": 0.9682952925562859,
+ "num_tokens": 5837321.0,
+ "step": 2500
+ },
+ {
+ "epoch": 6.219178082191781,
+ "eval_entropy": 0.2859006894882335,
+ "eval_loss": 0.7347224950790405,
+ "eval_mean_token_accuracy": 0.8501905518215757,
+ "eval_num_tokens": 5837321.0,
+ "eval_runtime": 85.7578,
+ "eval_samples_per_second": 16.034,
+ "eval_steps_per_second": 2.006,
+ "step": 2500
+ },
+ {
+ "entropy": 0.15765639198943973,
+ "epoch": 6.268991282689913,
+ "grad_norm": 0.47331130504608154,
+ "learning_rate": 8.324066858090663e-05,
+ "loss": 0.09571113586425781,
+ "mean_token_accuracy": 0.9683481335639954,
+ "num_tokens": 5884398.0,
+ "step": 2520
+ },
+ {
+ "epoch": 6.268991282689913,
+ "eval_entropy": 0.29231513846059176,
+ "eval_loss": 0.7392512559890747,
+ "eval_mean_token_accuracy": 0.8486633983462356,
+ "eval_num_tokens": 5884398.0,
+ "eval_runtime": 85.7846,
+ "eval_samples_per_second": 16.029,
+ "eval_steps_per_second": 2.005,
+ "step": 2520
+ },
+ {
+ "entropy": 0.16176860257983208,
+ "epoch": 6.318804483188045,
+ "grad_norm": 0.6142018437385559,
+ "learning_rate": 8.135028644470992e-05,
+ "loss": 0.09486144185066223,
+ "mean_token_accuracy": 0.9682316601276397,
+ "num_tokens": 5929876.0,
+ "step": 2540
+ },
+ {
+ "epoch": 6.318804483188045,
+ "eval_entropy": 0.2851274753379267,
+ "eval_loss": 0.7520816922187805,
+ "eval_mean_token_accuracy": 0.8501113649717597,
+ "eval_num_tokens": 5929876.0,
+ "eval_runtime": 85.9425,
+ "eval_samples_per_second": 15.999,
+ "eval_steps_per_second": 2.001,
+ "step": 2540
+ },
+ {
+ "entropy": 0.15404034564271568,
+ "epoch": 6.3686176836861765,
+ "grad_norm": 0.6051287651062012,
+ "learning_rate": 7.946949157063964e-05,
+ "loss": 0.09280472993850708,
+ "mean_token_accuracy": 0.9684635892510414,
+ "num_tokens": 5978490.0,
+ "step": 2560
+ },
+ {
+ "epoch": 6.3686176836861765,
+ "eval_entropy": 0.28802703563557114,
+ "eval_loss": 0.7439162135124207,
+ "eval_mean_token_accuracy": 0.8499851770872293,
+ "eval_num_tokens": 5978490.0,
+ "eval_runtime": 86.0703,
+ "eval_samples_per_second": 15.975,
+ "eval_steps_per_second": 1.998,
+ "step": 2560
+ },
+ {
+ "entropy": 0.15343588953837753,
+ "epoch": 6.418430884184309,
+ "grad_norm": 0.4823743402957916,
+ "learning_rate": 7.759885118077701e-05,
+ "loss": 0.09000591039657593,
+ "mean_token_accuracy": 0.9699928767979145,
+ "num_tokens": 6025380.0,
+ "step": 2580
+ },
+ {
+ "epoch": 6.418430884184309,
+ "eval_entropy": 0.2795634938533916,
+ "eval_loss": 0.7647850513458252,
+ "eval_mean_token_accuracy": 0.8503464397995971,
+ "eval_num_tokens": 6025380.0,
+ "eval_runtime": 85.8886,
+ "eval_samples_per_second": 16.009,
+ "eval_steps_per_second": 2.003,
+ "step": 2580
+ },
+ {
+ "entropy": 0.15740026142448188,
+ "epoch": 6.468244084682441,
+ "grad_norm": 0.5082696676254272,
+ "learning_rate": 7.57389294347494e-05,
+ "loss": 0.09191849827766418,
+ "mean_token_accuracy": 0.9692809768021107,
+ "num_tokens": 6073349.0,
+ "step": 2600
+ },
+ {
+ "epoch": 6.468244084682441,
+ "eval_entropy": 0.2913342311458532,
+ "eval_loss": 0.7518694996833801,
+ "eval_mean_token_accuracy": 0.8483168302580367,
+ "eval_num_tokens": 6073349.0,
+ "eval_runtime": 85.5761,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.01,
+ "step": 2600
+ },
+ {
+ "entropy": 0.15922069251537324,
+ "epoch": 6.518057285180573,
+ "grad_norm": 0.3995199501514435,
+ "learning_rate": 7.389028725958736e-05,
+ "loss": 0.09584367871284485,
+ "mean_token_accuracy": 0.9685114495456218,
+ "num_tokens": 6118148.0,
+ "step": 2620
+ },
+ {
+ "epoch": 6.518057285180573,
+ "eval_entropy": 0.2863075934177221,
+ "eval_loss": 0.7539381384849548,
+ "eval_mean_token_accuracy": 0.8507507083027862,
+ "eval_num_tokens": 6118148.0,
+ "eval_runtime": 86.112,
+ "eval_samples_per_second": 15.968,
+ "eval_steps_per_second": 1.997,
+ "step": 2620
+ },
+ {
+ "entropy": 0.16197575423866512,
+ "epoch": 6.567870485678705,
+ "grad_norm": 0.534295380115509,
+ "learning_rate": 7.205348218055678e-05,
+ "loss": 0.0961170256137848,
+ "mean_token_accuracy": 0.9674530044198036,
+ "num_tokens": 6165523.0,
+ "step": 2640
+ },
+ {
+ "epoch": 6.567870485678705,
+ "eval_entropy": 0.29021967315050057,
+ "eval_loss": 0.751198947429657,
+ "eval_mean_token_accuracy": 0.8509796344956686,
+ "eval_num_tokens": 6165523.0,
+ "eval_runtime": 85.7958,
+ "eval_samples_per_second": 16.026,
+ "eval_steps_per_second": 2.005,
+ "step": 2640
+ },
+ {
+ "entropy": 0.15261746793985367,
+ "epoch": 6.617683686176837,
+ "grad_norm": 0.5391237139701843,
+ "learning_rate": 7.022906815301673e-05,
+ "loss": 0.0926026999950409,
+ "mean_token_accuracy": 0.9695659473538398,
+ "num_tokens": 6216232.0,
+ "step": 2660
+ },
+ {
+ "epoch": 6.617683686176837,
+ "eval_entropy": 0.29128045216202736,
+ "eval_loss": 0.7450292110443115,
+ "eval_mean_token_accuracy": 0.8498771443616512,
+ "eval_num_tokens": 6216232.0,
+ "eval_runtime": 86.3963,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 2660
+ },
+ {
+ "entropy": 0.16164180357009172,
+ "epoch": 6.667496886674969,
+ "grad_norm": 0.5767946243286133,
+ "learning_rate": 6.841759539535419e-05,
+ "loss": 0.09291981458663941,
+ "mean_token_accuracy": 0.9687136687338352,
+ "num_tokens": 6264807.0,
+ "step": 2680
+ },
+ {
+ "epoch": 6.667496886674969,
+ "eval_entropy": 0.2897637223088464,
+ "eval_loss": 0.7503410577774048,
+ "eval_mean_token_accuracy": 0.8503315164599308,
+ "eval_num_tokens": 6264807.0,
+ "eval_runtime": 86.0653,
+ "eval_samples_per_second": 15.976,
+ "eval_steps_per_second": 1.998,
+ "step": 2680
+ },
+ {
+ "entropy": 0.17062523355707526,
+ "epoch": 6.717310087173101,
+ "grad_norm": 0.4974168539047241,
+ "learning_rate": 6.661961022304563e-05,
+ "loss": 0.09713236689567566,
+ "mean_token_accuracy": 0.9661971725523472,
+ "num_tokens": 6308819.0,
+ "step": 2700
+ },
+ {
+ "epoch": 6.717310087173101,
+ "eval_entropy": 0.2765843396963075,
+ "eval_loss": 0.7604002356529236,
+ "eval_mean_token_accuracy": 0.8521115277395692,
+ "eval_num_tokens": 6308819.0,
+ "eval_runtime": 86.1676,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 2700
+ },
+ {
+ "entropy": 0.17544092936441302,
+ "epoch": 6.767123287671232,
+ "grad_norm": 0.5523537993431091,
+ "learning_rate": 6.483565488389582e-05,
+ "loss": 0.09709116220474243,
+ "mean_token_accuracy": 0.9650957375764847,
+ "num_tokens": 6352548.0,
+ "step": 2720
+ },
+ {
+ "epoch": 6.767123287671232,
+ "eval_entropy": 0.27939334659035814,
+ "eval_loss": 0.7534670829772949,
+ "eval_mean_token_accuracy": 0.851230604010959,
+ "eval_num_tokens": 6352548.0,
+ "eval_runtime": 86.2913,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 2720
+ },
+ {
+ "entropy": 0.15991022661328316,
+ "epoch": 6.816936488169365,
+ "grad_norm": 0.478551983833313,
+ "learning_rate": 6.306626739450311e-05,
+ "loss": 0.09564646482467651,
+ "mean_token_accuracy": 0.9679084822535515,
+ "num_tokens": 6397720.0,
+ "step": 2740
+ },
+ {
+ "epoch": 6.816936488169365,
+ "eval_entropy": 0.27878295491601146,
+ "eval_loss": 0.7519959211349487,
+ "eval_mean_token_accuracy": 0.8510654949864676,
+ "eval_num_tokens": 6397720.0,
+ "eval_runtime": 85.9109,
+ "eval_samples_per_second": 16.005,
+ "eval_steps_per_second": 2.002,
+ "step": 2740
+ },
+ {
+ "entropy": 0.16824879590421915,
+ "epoch": 6.866749688667497,
+ "grad_norm": 0.6681098937988281,
+ "learning_rate": 6.131198137800108e-05,
+ "loss": 0.0962279736995697,
+ "mean_token_accuracy": 0.966830012947321,
+ "num_tokens": 6442821.0,
+ "step": 2760
+ },
+ {
+ "epoch": 6.866749688667497,
+ "eval_entropy": 0.2834690434121808,
+ "eval_loss": 0.751922070980072,
+ "eval_mean_token_accuracy": 0.8521237577809844,
+ "eval_num_tokens": 6442821.0,
+ "eval_runtime": 86.3618,
+ "eval_samples_per_second": 15.921,
+ "eval_steps_per_second": 1.992,
+ "step": 2760
+ },
+ {
+ "entropy": 0.1518704930320382,
+ "epoch": 6.916562889165629,
+ "grad_norm": 0.5201290249824524,
+ "learning_rate": 5.957332590312513e-05,
+ "loss": 0.09010660648345947,
+ "mean_token_accuracy": 0.9693463340401649,
+ "num_tokens": 6494118.0,
+ "step": 2780
+ },
+ {
+ "epoch": 6.916562889165629,
+ "eval_entropy": 0.28485129617674404,
+ "eval_loss": 0.7452457547187805,
+ "eval_mean_token_accuracy": 0.8512036796919135,
+ "eval_num_tokens": 6494118.0,
+ "eval_runtime": 86.4524,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2780
+ },
+ {
+ "entropy": 0.15512610590085388,
+ "epoch": 6.966376089663761,
+ "grad_norm": 0.42802050709724426,
+ "learning_rate": 5.785082532465233e-05,
+ "loss": 0.09320432543754578,
+ "mean_token_accuracy": 0.9686134628951549,
+ "num_tokens": 6540175.0,
+ "step": 2800
+ },
+ {
+ "epoch": 6.966376089663761,
+ "eval_entropy": 0.27554594526110693,
+ "eval_loss": 0.7644653916358948,
+ "eval_mean_token_accuracy": 0.8513738523389018,
+ "eval_num_tokens": 6540175.0,
+ "eval_runtime": 85.7609,
+ "eval_samples_per_second": 16.033,
+ "eval_steps_per_second": 2.006,
+ "step": 2800
+ },
+ {
+ "entropy": 0.17524497526196334,
+ "epoch": 7.01494396014944,
+ "grad_norm": 0.3330269157886505,
+ "learning_rate": 5.6144999125263545e-05,
+ "loss": 0.0895616888999939,
+ "mean_token_accuracy": 0.9682766932707566,
+ "num_tokens": 6583767.0,
+ "step": 2820
+ },
+ {
+ "epoch": 7.01494396014944,
+ "eval_entropy": 0.2735865569218647,
+ "eval_loss": 0.768479585647583,
+ "eval_mean_token_accuracy": 0.8503459383581959,
+ "eval_num_tokens": 6583767.0,
+ "eval_runtime": 85.7162,
+ "eval_samples_per_second": 16.041,
+ "eval_steps_per_second": 2.007,
+ "step": 2820
+ },
+ {
+ "entropy": 0.1403565663844347,
+ "epoch": 7.064757160647572,
+ "grad_norm": 0.35613498091697693,
+ "learning_rate": 5.4456361758874235e-05,
+ "loss": 0.07551313638687134,
+ "mean_token_accuracy": 0.9739301167428493,
+ "num_tokens": 6627672.0,
+ "step": 2840
+ },
+ {
+ "epoch": 7.064757160647572,
+ "eval_entropy": 0.25941789089593775,
+ "eval_loss": 0.8209511637687683,
+ "eval_mean_token_accuracy": 0.8505055855873019,
+ "eval_num_tokens": 6627672.0,
+ "eval_runtime": 86.0943,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 2840
+ },
+ {
+ "entropy": 0.13500106502324344,
+ "epoch": 7.114570361145703,
+ "grad_norm": 0.34418627619743347,
+ "learning_rate": 5.2785422495482234e-05,
+ "loss": 0.07293946146965027,
+ "mean_token_accuracy": 0.9747208289802074,
+ "num_tokens": 6672946.0,
+ "step": 2860
+ },
+ {
+ "epoch": 7.114570361145703,
+ "eval_entropy": 0.26482899772912954,
+ "eval_loss": 0.798904538154602,
+ "eval_mean_token_accuracy": 0.8511530233677044,
+ "eval_num_tokens": 6672946.0,
+ "eval_runtime": 85.7915,
+ "eval_samples_per_second": 16.027,
+ "eval_steps_per_second": 2.005,
+ "step": 2860
+ },
+ {
+ "entropy": 0.13127502552233636,
+ "epoch": 7.164383561643835,
+ "grad_norm": 0.4638441503047943,
+ "learning_rate": 5.113268526757892e-05,
+ "loss": 0.07121461629867554,
+ "mean_token_accuracy": 0.9756786689162255,
+ "num_tokens": 6718582.0,
+ "step": 2880
+ },
+ {
+ "epoch": 7.164383561643835,
+ "eval_entropy": 0.2645381211714689,
+ "eval_loss": 0.809101939201355,
+ "eval_mean_token_accuracy": 0.8514727898115335,
+ "eval_num_tokens": 6718582.0,
+ "eval_runtime": 85.84,
+ "eval_samples_per_second": 16.018,
+ "eval_steps_per_second": 2.004,
+ "step": 2880
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.832412199911895e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2900/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2900/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2900/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2900/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2900/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2900/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2900/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2900/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2900/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2900/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2900/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2900/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2900/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2900/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..17575cdf941af726450aceec740f48d8b363527c
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2900/trainer_state.json
@@ -0,0 +1,3079 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 7.214196762141968,
+ "eval_steps": 20,
+ "global_step": 2900,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ },
+ {
+ "entropy": 0.3193941755220294,
+ "epoch": 4.5280199252802,
+ "grad_norm": 0.8281906843185425,
+ "learning_rate": 0.0001509111761786888,
+ "loss": 0.23936262130737304,
+ "mean_token_accuracy": 0.9201708927750587,
+ "num_tokens": 4244423.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.5280199252802,
+ "eval_entropy": 0.38704028864239537,
+ "eval_loss": 0.6006569266319275,
+ "eval_mean_token_accuracy": 0.8502406720505205,
+ "eval_num_tokens": 4244423.0,
+ "eval_runtime": 86.8059,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1820
+ },
+ {
+ "entropy": 0.3164879363030195,
+ "epoch": 4.577833125778331,
+ "grad_norm": 0.7892968654632568,
+ "learning_rate": 0.00014905346557909867,
+ "loss": 0.24541733264923096,
+ "mean_token_accuracy": 0.9175932116806507,
+ "num_tokens": 4289773.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.577833125778331,
+ "eval_entropy": 0.38861122120951497,
+ "eval_loss": 0.6115967631340027,
+ "eval_mean_token_accuracy": 0.849471275196519,
+ "eval_num_tokens": 4289773.0,
+ "eval_runtime": 86.2946,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1840
+ },
+ {
+ "entropy": 0.3051785985007882,
+ "epoch": 4.627646326276463,
+ "grad_norm": 0.8109654188156128,
+ "learning_rate": 0.0001471849238862319,
+ "loss": 0.23433220386505127,
+ "mean_token_accuracy": 0.9206570319831371,
+ "num_tokens": 4336894.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.627646326276463,
+ "eval_entropy": 0.37162452295076015,
+ "eval_loss": 0.6184061765670776,
+ "eval_mean_token_accuracy": 0.8501173268223918,
+ "eval_num_tokens": 4336894.0,
+ "eval_runtime": 86.6865,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1860
+ },
+ {
+ "entropy": 0.3168198253959417,
+ "epoch": 4.677459526774595,
+ "grad_norm": 0.9512342214584351,
+ "learning_rate": 0.0001453061146267775,
+ "loss": 0.23832404613494873,
+ "mean_token_accuracy": 0.9197044663131237,
+ "num_tokens": 4382947.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.677459526774595,
+ "eval_entropy": 0.3845940856912801,
+ "eval_loss": 0.606762707233429,
+ "eval_mean_token_accuracy": 0.8504838194957999,
+ "eval_num_tokens": 4382947.0,
+ "eval_runtime": 86.5175,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 1880
+ },
+ {
+ "entropy": 0.30791807882487776,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 0.8123113512992859,
+ "learning_rate": 0.00014341760442398248,
+ "loss": 0.2395785331726074,
+ "mean_token_accuracy": 0.918928150832653,
+ "num_tokens": 4433050.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.7272727272727275,
+ "eval_entropy": 0.39762327222283494,
+ "eval_loss": 0.5994202494621277,
+ "eval_mean_token_accuracy": 0.8509274201337681,
+ "eval_num_tokens": 4433050.0,
+ "eval_runtime": 86.2873,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.993,
+ "step": 1900
+ },
+ {
+ "entropy": 0.3021434534341097,
+ "epoch": 4.777085927770859,
+ "grad_norm": 0.731787383556366,
+ "learning_rate": 0.000141519962826766,
+ "loss": 0.23494718074798585,
+ "mean_token_accuracy": 0.9201403826475143,
+ "num_tokens": 4483598.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.777085927770859,
+ "eval_entropy": 0.3827026732439219,
+ "eval_loss": 0.5995895862579346,
+ "eval_mean_token_accuracy": 0.851468373523202,
+ "eval_num_tokens": 4483598.0,
+ "eval_runtime": 86.3006,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 1920
+ },
+ {
+ "entropy": 0.31626159623265265,
+ "epoch": 4.826899128268991,
+ "grad_norm": 0.8848487138748169,
+ "learning_rate": 0.00013961376213795132,
+ "loss": 0.2439030647277832,
+ "mean_token_accuracy": 0.9196575872600079,
+ "num_tokens": 4529201.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.826899128268991,
+ "eval_entropy": 0.388698436839636,
+ "eval_loss": 0.6000174283981323,
+ "eval_mean_token_accuracy": 0.8518068187458571,
+ "eval_num_tokens": 4529201.0,
+ "eval_runtime": 86.8979,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.979,
+ "step": 1940
+ },
+ {
+ "entropy": 0.30520407035946845,
+ "epoch": 4.876712328767123,
+ "grad_norm": 0.8532460927963257,
+ "learning_rate": 0.00013769957724166695,
+ "loss": 0.23458616733551024,
+ "mean_token_accuracy": 0.9221912942826748,
+ "num_tokens": 4578167.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.876712328767123,
+ "eval_entropy": 0.38777847102908203,
+ "eval_loss": 0.6004981398582458,
+ "eval_mean_token_accuracy": 0.8516481768253238,
+ "eval_num_tokens": 4578167.0,
+ "eval_runtime": 87.0777,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.975,
+ "step": 1960
+ },
+ {
+ "entropy": 0.3226448342204094,
+ "epoch": 4.926525529265255,
+ "grad_norm": 0.6945561766624451,
+ "learning_rate": 0.0001357779854299694,
+ "loss": 0.24048397541046143,
+ "mean_token_accuracy": 0.9195300146937371,
+ "num_tokens": 4622316.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.926525529265255,
+ "eval_entropy": 0.38581624263247777,
+ "eval_loss": 0.6029234528541565,
+ "eval_mean_token_accuracy": 0.8514213260523108,
+ "eval_num_tokens": 4622316.0,
+ "eval_runtime": 85.8729,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 1980
+ },
+ {
+ "entropy": 0.3051655298098922,
+ "epoch": 4.976338729763388,
+ "grad_norm": 0.7976452708244324,
+ "learning_rate": 0.00013384956622874001,
+ "loss": 0.23584742546081544,
+ "mean_token_accuracy": 0.9216851457953453,
+ "num_tokens": 4670746.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.976338729763388,
+ "eval_entropy": 0.37913159246361533,
+ "eval_loss": 0.6057604551315308,
+ "eval_mean_token_accuracy": 0.8525801203971686,
+ "eval_num_tokens": 4670746.0,
+ "eval_runtime": 86.1145,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2000
+ },
+ {
+ "entropy": 0.27438195240803254,
+ "epoch": 5.024906600249066,
+ "grad_norm": 0.6729586124420166,
+ "learning_rate": 0.0001319149012229075,
+ "loss": 0.19775952100753785,
+ "mean_token_accuracy": 0.9339428559327737,
+ "num_tokens": 4716176.0,
+ "step": 2020
+ },
+ {
+ "epoch": 5.024906600249066,
+ "eval_entropy": 0.3448961910813354,
+ "eval_loss": 0.6750120520591736,
+ "eval_mean_token_accuracy": 0.8487970232963562,
+ "eval_num_tokens": 4716176.0,
+ "eval_runtime": 86.1169,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2020
+ },
+ {
+ "entropy": 0.21423916313797237,
+ "epoch": 5.074719800747198,
+ "grad_norm": 0.6934391856193542,
+ "learning_rate": 0.00012997457388105022,
+ "loss": 0.1439570426940918,
+ "mean_token_accuracy": 0.9528236843645572,
+ "num_tokens": 4763269.0,
+ "step": 2040
+ },
+ {
+ "epoch": 5.074719800747198,
+ "eval_entropy": 0.3570949243771475,
+ "eval_loss": 0.6465504169464111,
+ "eval_mean_token_accuracy": 0.8490785547467166,
+ "eval_num_tokens": 4763269.0,
+ "eval_runtime": 85.9574,
+ "eval_samples_per_second": 15.996,
+ "eval_steps_per_second": 2.001,
+ "step": 2040
+ },
+ {
+ "entropy": 0.20838565267622472,
+ "epoch": 5.12453300124533,
+ "grad_norm": 0.7286986112594604,
+ "learning_rate": 0.00012802916937942972,
+ "loss": 0.14467307329177856,
+ "mean_token_accuracy": 0.950994835793972,
+ "num_tokens": 4809047.0,
+ "step": 2060
+ },
+ {
+ "epoch": 5.12453300124533,
+ "eval_entropy": 0.3452463157821533,
+ "eval_loss": 0.6705958843231201,
+ "eval_mean_token_accuracy": 0.8490352796953778,
+ "eval_num_tokens": 4809047.0,
+ "eval_runtime": 86.228,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 2060
+ },
+ {
+ "entropy": 0.20453082229942082,
+ "epoch": 5.174346201743462,
+ "grad_norm": 0.7515555620193481,
+ "learning_rate": 0.00012607927442550974,
+ "loss": 0.13732000589370727,
+ "mean_token_accuracy": 0.9537357829511166,
+ "num_tokens": 4857965.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.174346201743462,
+ "eval_entropy": 0.32431264914745506,
+ "eval_loss": 0.6743043065071106,
+ "eval_mean_token_accuracy": 0.8504878629085629,
+ "eval_num_tokens": 4857965.0,
+ "eval_runtime": 86.5948,
+ "eval_samples_per_second": 15.879,
+ "eval_steps_per_second": 1.986,
+ "step": 2080
+ },
+ {
+ "entropy": 0.21812320686876774,
+ "epoch": 5.224159402241594,
+ "grad_norm": 0.9093465209007263,
+ "learning_rate": 0.0001241254770810132,
+ "loss": 0.14311420917510986,
+ "mean_token_accuracy": 0.9514068141579628,
+ "num_tokens": 4905151.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.224159402241594,
+ "eval_entropy": 0.33086285835435225,
+ "eval_loss": 0.6676449179649353,
+ "eval_mean_token_accuracy": 0.8505287662495015,
+ "eval_num_tokens": 4905151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 2100
+ },
+ {
+ "entropy": 0.2180163251236081,
+ "epoch": 5.273972602739726,
+ "grad_norm": 0.6703007221221924,
+ "learning_rate": 0.00012216836658457075,
+ "loss": 0.14803968667984008,
+ "mean_token_accuracy": 0.9521303348243236,
+ "num_tokens": 4947072.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.273972602739726,
+ "eval_entropy": 0.33162341708707255,
+ "eval_loss": 0.6658875942230225,
+ "eval_mean_token_accuracy": 0.8500757605530495,
+ "eval_num_tokens": 4947072.0,
+ "eval_runtime": 86.6296,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 2120
+ },
+ {
+ "entropy": 0.22511130161583423,
+ "epoch": 5.323785803237858,
+ "grad_norm": 0.8078880906105042,
+ "learning_rate": 0.00012020853317401455,
+ "loss": 0.15228408575057983,
+ "mean_token_accuracy": 0.947144789993763,
+ "num_tokens": 4991974.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.323785803237858,
+ "eval_entropy": 0.3354601170434508,
+ "eval_loss": 0.6677829623222351,
+ "eval_mean_token_accuracy": 0.8482600024273229,
+ "eval_num_tokens": 4991974.0,
+ "eval_runtime": 86.4689,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.989,
+ "step": 2140
+ },
+ {
+ "entropy": 0.2244176059961319,
+ "epoch": 5.37359900373599,
+ "grad_norm": 0.9636075496673584,
+ "learning_rate": 0.00011824656790837037,
+ "loss": 0.15260883569717407,
+ "mean_token_accuracy": 0.9471467643976211,
+ "num_tokens": 5038400.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.37359900373599,
+ "eval_entropy": 0.3381616926297199,
+ "eval_loss": 0.6694412231445312,
+ "eval_mean_token_accuracy": 0.8482369603805764,
+ "eval_num_tokens": 5038400.0,
+ "eval_runtime": 86.4147,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 2160
+ },
+ {
+ "entropy": 0.22982364390045404,
+ "epoch": 5.423412204234122,
+ "grad_norm": 0.775401771068573,
+ "learning_rate": 0.00011628306248960262,
+ "loss": 0.15140302181243898,
+ "mean_token_accuracy": 0.9492553934454918,
+ "num_tokens": 5083166.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.423412204234122,
+ "eval_entropy": 0.3305150235808173,
+ "eval_loss": 0.6717822551727295,
+ "eval_mean_token_accuracy": 0.8489849723355715,
+ "eval_num_tokens": 5083166.0,
+ "eval_runtime": 86.4728,
+ "eval_samples_per_second": 15.901,
+ "eval_steps_per_second": 1.989,
+ "step": 2180
+ },
+ {
+ "entropy": 0.21448935717344284,
+ "epoch": 5.473225404732254,
+ "grad_norm": 0.6575281023979187,
+ "learning_rate": 0.00011431860908416465,
+ "loss": 0.1452319622039795,
+ "mean_token_accuracy": 0.9505287684500218,
+ "num_tokens": 5135109.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.473225404732254,
+ "eval_entropy": 0.3488145174328671,
+ "eval_loss": 0.6612305641174316,
+ "eval_mean_token_accuracy": 0.8492907808963642,
+ "eval_num_tokens": 5135109.0,
+ "eval_runtime": 86.6927,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 2200
+ },
+ {
+ "entropy": 0.23091202937066554,
+ "epoch": 5.523038605230386,
+ "grad_norm": 0.8909686207771301,
+ "learning_rate": 0.00011235380014440985,
+ "loss": 0.15150139331817628,
+ "mean_token_accuracy": 0.9497875183820724,
+ "num_tokens": 5180138.0,
+ "step": 2220
+ },
+ {
+ "epoch": 5.523038605230386,
+ "eval_entropy": 0.3268539015810157,
+ "eval_loss": 0.6667542457580566,
+ "eval_mean_token_accuracy": 0.8499062903398691,
+ "eval_num_tokens": 5180138.0,
+ "eval_runtime": 86.4644,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 2220
+ },
+ {
+ "entropy": 0.2227974807843566,
+ "epoch": 5.572851805728518,
+ "grad_norm": 0.6180275082588196,
+ "learning_rate": 0.0001103892282299158,
+ "loss": 0.1491069197654724,
+ "mean_token_accuracy": 0.9488144010305405,
+ "num_tokens": 5226864.0,
+ "step": 2240
+ },
+ {
+ "epoch": 5.572851805728518,
+ "eval_entropy": 0.3346347655494546,
+ "eval_loss": 0.6665948629379272,
+ "eval_mean_token_accuracy": 0.8499961893918903,
+ "eval_num_tokens": 5226864.0,
+ "eval_runtime": 87.0548,
+ "eval_samples_per_second": 15.795,
+ "eval_steps_per_second": 1.976,
+ "step": 2240
+ },
+ {
+ "entropy": 0.21368421968072654,
+ "epoch": 5.62266500622665,
+ "grad_norm": 0.6004369258880615,
+ "learning_rate": 0.00010842548582877651,
+ "loss": 0.14485255479812623,
+ "mean_token_accuracy": 0.9502056457102299,
+ "num_tokens": 5276602.0,
+ "step": 2260
+ },
+ {
+ "epoch": 5.62266500622665,
+ "eval_entropy": 0.32753298804163933,
+ "eval_loss": 0.6680151224136353,
+ "eval_mean_token_accuracy": 0.8515451086121936,
+ "eval_num_tokens": 5276602.0,
+ "eval_runtime": 86.8524,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.98,
+ "step": 2260
+ },
+ {
+ "entropy": 0.2103635374456644,
+ "epoch": 5.672478206724782,
+ "grad_norm": 0.699174702167511,
+ "learning_rate": 0.00010646316517891613,
+ "loss": 0.14297772645950318,
+ "mean_token_accuracy": 0.9512537539005279,
+ "num_tokens": 5323718.0,
+ "step": 2280
+ },
+ {
+ "epoch": 5.672478206724782,
+ "eval_entropy": 0.32966585959806,
+ "eval_loss": 0.675578773021698,
+ "eval_mean_token_accuracy": 0.8509623023659684,
+ "eval_num_tokens": 5323718.0,
+ "eval_runtime": 86.4518,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2280
+ },
+ {
+ "entropy": 0.22516900151968003,
+ "epoch": 5.722291407222914,
+ "grad_norm": 0.6637354493141174,
+ "learning_rate": 0.00010450285808947797,
+ "loss": 0.15202572345733642,
+ "mean_token_accuracy": 0.9482452072203159,
+ "num_tokens": 5369039.0,
+ "step": 2300
+ },
+ {
+ "epoch": 5.722291407222914,
+ "eval_entropy": 0.3369456917740578,
+ "eval_loss": 0.6697061061859131,
+ "eval_mean_token_accuracy": 0.848603522361711,
+ "eval_num_tokens": 5369039.0,
+ "eval_runtime": 86.6371,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.985,
+ "step": 2300
+ },
+ {
+ "entropy": 0.21841065725311637,
+ "epoch": 5.772104607721046,
+ "grad_norm": 0.7940268516540527,
+ "learning_rate": 0.00010254515576234297,
+ "loss": 0.14710167646408082,
+ "mean_token_accuracy": 0.9493498183786869,
+ "num_tokens": 5417029.0,
+ "step": 2320
+ },
+ {
+ "epoch": 5.772104607721046,
+ "eval_entropy": 0.3237486180177955,
+ "eval_loss": 0.6779657602310181,
+ "eval_mean_token_accuracy": 0.8500715313955794,
+ "eval_num_tokens": 5417029.0,
+ "eval_runtime": 86.1826,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 1.996,
+ "step": 2320
+ },
+ {
+ "entropy": 0.22146204356104135,
+ "epoch": 5.821917808219178,
+ "grad_norm": 0.9234833121299744,
+ "learning_rate": 0.00010059064861383132,
+ "loss": 0.14720046520233154,
+ "mean_token_accuracy": 0.9493872679769992,
+ "num_tokens": 5461671.0,
+ "step": 2340
+ },
+ {
+ "epoch": 5.821917808219178,
+ "eval_entropy": 0.32365207564692167,
+ "eval_loss": 0.6704005002975464,
+ "eval_mean_token_accuracy": 0.8507985760306203,
+ "eval_num_tokens": 5461671.0,
+ "eval_runtime": 86.5494,
+ "eval_samples_per_second": 15.887,
+ "eval_steps_per_second": 1.987,
+ "step": 2340
+ },
+ {
+ "entropy": 0.20934011954814197,
+ "epoch": 5.87173100871731,
+ "grad_norm": 0.5547503232955933,
+ "learning_rate": 9.863992609664084e-05,
+ "loss": 0.1464867353439331,
+ "mean_token_accuracy": 0.9503875687718392,
+ "num_tokens": 5509312.0,
+ "step": 2360
+ },
+ {
+ "epoch": 5.87173100871731,
+ "eval_entropy": 0.3330401429083458,
+ "eval_loss": 0.6659091114997864,
+ "eval_mean_token_accuracy": 0.8504848906467127,
+ "eval_num_tokens": 5509312.0,
+ "eval_runtime": 86.5855,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 2360
+ },
+ {
+ "entropy": 0.21678635366261007,
+ "epoch": 5.921544209215442,
+ "grad_norm": 0.570612907409668,
+ "learning_rate": 9.669357652207635e-05,
+ "loss": 0.14821385145187377,
+ "mean_token_accuracy": 0.9503940217196941,
+ "num_tokens": 5558196.0,
+ "step": 2380
+ },
+ {
+ "epoch": 5.921544209215442,
+ "eval_entropy": 0.3322022325077722,
+ "eval_loss": 0.6722489595413208,
+ "eval_mean_token_accuracy": 0.8489979422369669,
+ "eval_num_tokens": 5558196.0,
+ "eval_runtime": 86.2986,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 2380
+ },
+ {
+ "entropy": 0.20932920072227718,
+ "epoch": 5.971357409713574,
+ "grad_norm": 0.7879557609558105,
+ "learning_rate": 9.475218688262262e-05,
+ "loss": 0.14675841331481934,
+ "mean_token_accuracy": 0.9507176131010056,
+ "num_tokens": 5605400.0,
+ "step": 2400
+ },
+ {
+ "epoch": 5.971357409713574,
+ "eval_entropy": 0.3199348642902319,
+ "eval_loss": 0.6698136329650879,
+ "eval_mean_token_accuracy": 0.8514142130003419,
+ "eval_num_tokens": 5605400.0,
+ "eval_runtime": 85.8995,
+ "eval_samples_per_second": 16.007,
+ "eval_steps_per_second": 2.002,
+ "step": 2400
+ },
+ {
+ "entropy": 0.21032143919131693,
+ "epoch": 6.019925280199253,
+ "grad_norm": 0.5823076367378235,
+ "learning_rate": 9.281634267491569e-05,
+ "loss": 0.13322267532348633,
+ "mean_token_accuracy": 0.9550939072401096,
+ "num_tokens": 5648968.0,
+ "step": 2420
+ },
+ {
+ "epoch": 6.019925280199253,
+ "eval_entropy": 0.30206270117399303,
+ "eval_loss": 0.7093168497085571,
+ "eval_mean_token_accuracy": 0.8500627639681794,
+ "eval_num_tokens": 5648968.0,
+ "eval_runtime": 85.8128,
+ "eval_samples_per_second": 16.023,
+ "eval_steps_per_second": 2.004,
+ "step": 2420
+ },
+ {
+ "entropy": 0.1534628233872354,
+ "epoch": 6.069738480697385,
+ "grad_norm": 0.710133969783783,
+ "learning_rate": 9.088662772316508e-05,
+ "loss": 0.09078952670097351,
+ "mean_token_accuracy": 0.9678447999060154,
+ "num_tokens": 5697633.0,
+ "step": 2440
+ },
+ {
+ "epoch": 6.069738480697385,
+ "eval_entropy": 0.28208133101809857,
+ "eval_loss": 0.7636417150497437,
+ "eval_mean_token_accuracy": 0.8494061477655588,
+ "eval_num_tokens": 5697633.0,
+ "eval_runtime": 85.9724,
+ "eval_samples_per_second": 15.994,
+ "eval_steps_per_second": 2.001,
+ "step": 2440
+ },
+ {
+ "entropy": 0.16151462448760867,
+ "epoch": 6.119551681195516,
+ "grad_norm": 0.5793812274932861,
+ "learning_rate": 8.896362400308028e-05,
+ "loss": 0.09545697569847107,
+ "mean_token_accuracy": 0.9671573750674725,
+ "num_tokens": 5745090.0,
+ "step": 2460
+ },
+ {
+ "epoch": 6.119551681195516,
+ "eval_entropy": 0.2833245605403601,
+ "eval_loss": 0.7402405738830566,
+ "eval_mean_token_accuracy": 0.8503523728875226,
+ "eval_num_tokens": 5745090.0,
+ "eval_runtime": 85.5461,
+ "eval_samples_per_second": 16.073,
+ "eval_steps_per_second": 2.011,
+ "step": 2460
+ },
+ {
+ "entropy": 0.15203177919611335,
+ "epoch": 6.169364881693649,
+ "grad_norm": 0.4251123368740082,
+ "learning_rate": 8.704791146635483e-05,
+ "loss": 0.09420782327651978,
+ "mean_token_accuracy": 0.9677386932075024,
+ "num_tokens": 5790333.0,
+ "step": 2480
+ },
+ {
+ "epoch": 6.169364881693649,
+ "eval_entropy": 0.28572545962971313,
+ "eval_loss": 0.735416829586029,
+ "eval_mean_token_accuracy": 0.8487084663884584,
+ "eval_num_tokens": 5790333.0,
+ "eval_runtime": 85.4801,
+ "eval_samples_per_second": 16.086,
+ "eval_steps_per_second": 2.012,
+ "step": 2480
+ },
+ {
+ "entropy": 0.15587336672469973,
+ "epoch": 6.219178082191781,
+ "grad_norm": 0.4357028007507324,
+ "learning_rate": 8.514006786576085e-05,
+ "loss": 0.09429320096969604,
+ "mean_token_accuracy": 0.9682952925562859,
+ "num_tokens": 5837321.0,
+ "step": 2500
+ },
+ {
+ "epoch": 6.219178082191781,
+ "eval_entropy": 0.2859006894882335,
+ "eval_loss": 0.7347224950790405,
+ "eval_mean_token_accuracy": 0.8501905518215757,
+ "eval_num_tokens": 5837321.0,
+ "eval_runtime": 85.7578,
+ "eval_samples_per_second": 16.034,
+ "eval_steps_per_second": 2.006,
+ "step": 2500
+ },
+ {
+ "entropy": 0.15765639198943973,
+ "epoch": 6.268991282689913,
+ "grad_norm": 0.47331130504608154,
+ "learning_rate": 8.324066858090663e-05,
+ "loss": 0.09571113586425781,
+ "mean_token_accuracy": 0.9683481335639954,
+ "num_tokens": 5884398.0,
+ "step": 2520
+ },
+ {
+ "epoch": 6.268991282689913,
+ "eval_entropy": 0.29231513846059176,
+ "eval_loss": 0.7392512559890747,
+ "eval_mean_token_accuracy": 0.8486633983462356,
+ "eval_num_tokens": 5884398.0,
+ "eval_runtime": 85.7846,
+ "eval_samples_per_second": 16.029,
+ "eval_steps_per_second": 2.005,
+ "step": 2520
+ },
+ {
+ "entropy": 0.16176860257983208,
+ "epoch": 6.318804483188045,
+ "grad_norm": 0.6142018437385559,
+ "learning_rate": 8.135028644470992e-05,
+ "loss": 0.09486144185066223,
+ "mean_token_accuracy": 0.9682316601276397,
+ "num_tokens": 5929876.0,
+ "step": 2540
+ },
+ {
+ "epoch": 6.318804483188045,
+ "eval_entropy": 0.2851274753379267,
+ "eval_loss": 0.7520816922187805,
+ "eval_mean_token_accuracy": 0.8501113649717597,
+ "eval_num_tokens": 5929876.0,
+ "eval_runtime": 85.9425,
+ "eval_samples_per_second": 15.999,
+ "eval_steps_per_second": 2.001,
+ "step": 2540
+ },
+ {
+ "entropy": 0.15404034564271568,
+ "epoch": 6.3686176836861765,
+ "grad_norm": 0.6051287651062012,
+ "learning_rate": 7.946949157063964e-05,
+ "loss": 0.09280472993850708,
+ "mean_token_accuracy": 0.9684635892510414,
+ "num_tokens": 5978490.0,
+ "step": 2560
+ },
+ {
+ "epoch": 6.3686176836861765,
+ "eval_entropy": 0.28802703563557114,
+ "eval_loss": 0.7439162135124207,
+ "eval_mean_token_accuracy": 0.8499851770872293,
+ "eval_num_tokens": 5978490.0,
+ "eval_runtime": 86.0703,
+ "eval_samples_per_second": 15.975,
+ "eval_steps_per_second": 1.998,
+ "step": 2560
+ },
+ {
+ "entropy": 0.15343588953837753,
+ "epoch": 6.418430884184309,
+ "grad_norm": 0.4823743402957916,
+ "learning_rate": 7.759885118077701e-05,
+ "loss": 0.09000591039657593,
+ "mean_token_accuracy": 0.9699928767979145,
+ "num_tokens": 6025380.0,
+ "step": 2580
+ },
+ {
+ "epoch": 6.418430884184309,
+ "eval_entropy": 0.2795634938533916,
+ "eval_loss": 0.7647850513458252,
+ "eval_mean_token_accuracy": 0.8503464397995971,
+ "eval_num_tokens": 6025380.0,
+ "eval_runtime": 85.8886,
+ "eval_samples_per_second": 16.009,
+ "eval_steps_per_second": 2.003,
+ "step": 2580
+ },
+ {
+ "entropy": 0.15740026142448188,
+ "epoch": 6.468244084682441,
+ "grad_norm": 0.5082696676254272,
+ "learning_rate": 7.57389294347494e-05,
+ "loss": 0.09191849827766418,
+ "mean_token_accuracy": 0.9692809768021107,
+ "num_tokens": 6073349.0,
+ "step": 2600
+ },
+ {
+ "epoch": 6.468244084682441,
+ "eval_entropy": 0.2913342311458532,
+ "eval_loss": 0.7518694996833801,
+ "eval_mean_token_accuracy": 0.8483168302580367,
+ "eval_num_tokens": 6073349.0,
+ "eval_runtime": 85.5761,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.01,
+ "step": 2600
+ },
+ {
+ "entropy": 0.15922069251537324,
+ "epoch": 6.518057285180573,
+ "grad_norm": 0.3995199501514435,
+ "learning_rate": 7.389028725958736e-05,
+ "loss": 0.09584367871284485,
+ "mean_token_accuracy": 0.9685114495456218,
+ "num_tokens": 6118148.0,
+ "step": 2620
+ },
+ {
+ "epoch": 6.518057285180573,
+ "eval_entropy": 0.2863075934177221,
+ "eval_loss": 0.7539381384849548,
+ "eval_mean_token_accuracy": 0.8507507083027862,
+ "eval_num_tokens": 6118148.0,
+ "eval_runtime": 86.112,
+ "eval_samples_per_second": 15.968,
+ "eval_steps_per_second": 1.997,
+ "step": 2620
+ },
+ {
+ "entropy": 0.16197575423866512,
+ "epoch": 6.567870485678705,
+ "grad_norm": 0.534295380115509,
+ "learning_rate": 7.205348218055678e-05,
+ "loss": 0.0961170256137848,
+ "mean_token_accuracy": 0.9674530044198036,
+ "num_tokens": 6165523.0,
+ "step": 2640
+ },
+ {
+ "epoch": 6.567870485678705,
+ "eval_entropy": 0.29021967315050057,
+ "eval_loss": 0.751198947429657,
+ "eval_mean_token_accuracy": 0.8509796344956686,
+ "eval_num_tokens": 6165523.0,
+ "eval_runtime": 85.7958,
+ "eval_samples_per_second": 16.026,
+ "eval_steps_per_second": 2.005,
+ "step": 2640
+ },
+ {
+ "entropy": 0.15261746793985367,
+ "epoch": 6.617683686176837,
+ "grad_norm": 0.5391237139701843,
+ "learning_rate": 7.022906815301673e-05,
+ "loss": 0.0926026999950409,
+ "mean_token_accuracy": 0.9695659473538398,
+ "num_tokens": 6216232.0,
+ "step": 2660
+ },
+ {
+ "epoch": 6.617683686176837,
+ "eval_entropy": 0.29128045216202736,
+ "eval_loss": 0.7450292110443115,
+ "eval_mean_token_accuracy": 0.8498771443616512,
+ "eval_num_tokens": 6216232.0,
+ "eval_runtime": 86.3963,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 2660
+ },
+ {
+ "entropy": 0.16164180357009172,
+ "epoch": 6.667496886674969,
+ "grad_norm": 0.5767946243286133,
+ "learning_rate": 6.841759539535419e-05,
+ "loss": 0.09291981458663941,
+ "mean_token_accuracy": 0.9687136687338352,
+ "num_tokens": 6264807.0,
+ "step": 2680
+ },
+ {
+ "epoch": 6.667496886674969,
+ "eval_entropy": 0.2897637223088464,
+ "eval_loss": 0.7503410577774048,
+ "eval_mean_token_accuracy": 0.8503315164599308,
+ "eval_num_tokens": 6264807.0,
+ "eval_runtime": 86.0653,
+ "eval_samples_per_second": 15.976,
+ "eval_steps_per_second": 1.998,
+ "step": 2680
+ },
+ {
+ "entropy": 0.17062523355707526,
+ "epoch": 6.717310087173101,
+ "grad_norm": 0.4974168539047241,
+ "learning_rate": 6.661961022304563e-05,
+ "loss": 0.09713236689567566,
+ "mean_token_accuracy": 0.9661971725523472,
+ "num_tokens": 6308819.0,
+ "step": 2700
+ },
+ {
+ "epoch": 6.717310087173101,
+ "eval_entropy": 0.2765843396963075,
+ "eval_loss": 0.7604002356529236,
+ "eval_mean_token_accuracy": 0.8521115277395692,
+ "eval_num_tokens": 6308819.0,
+ "eval_runtime": 86.1676,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 2700
+ },
+ {
+ "entropy": 0.17544092936441302,
+ "epoch": 6.767123287671232,
+ "grad_norm": 0.5523537993431091,
+ "learning_rate": 6.483565488389582e-05,
+ "loss": 0.09709116220474243,
+ "mean_token_accuracy": 0.9650957375764847,
+ "num_tokens": 6352548.0,
+ "step": 2720
+ },
+ {
+ "epoch": 6.767123287671232,
+ "eval_entropy": 0.27939334659035814,
+ "eval_loss": 0.7534670829772949,
+ "eval_mean_token_accuracy": 0.851230604010959,
+ "eval_num_tokens": 6352548.0,
+ "eval_runtime": 86.2913,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 2720
+ },
+ {
+ "entropy": 0.15991022661328316,
+ "epoch": 6.816936488169365,
+ "grad_norm": 0.478551983833313,
+ "learning_rate": 6.306626739450311e-05,
+ "loss": 0.09564646482467651,
+ "mean_token_accuracy": 0.9679084822535515,
+ "num_tokens": 6397720.0,
+ "step": 2740
+ },
+ {
+ "epoch": 6.816936488169365,
+ "eval_entropy": 0.27878295491601146,
+ "eval_loss": 0.7519959211349487,
+ "eval_mean_token_accuracy": 0.8510654949864676,
+ "eval_num_tokens": 6397720.0,
+ "eval_runtime": 85.9109,
+ "eval_samples_per_second": 16.005,
+ "eval_steps_per_second": 2.002,
+ "step": 2740
+ },
+ {
+ "entropy": 0.16824879590421915,
+ "epoch": 6.866749688667497,
+ "grad_norm": 0.6681098937988281,
+ "learning_rate": 6.131198137800108e-05,
+ "loss": 0.0962279736995697,
+ "mean_token_accuracy": 0.966830012947321,
+ "num_tokens": 6442821.0,
+ "step": 2760
+ },
+ {
+ "epoch": 6.866749688667497,
+ "eval_entropy": 0.2834690434121808,
+ "eval_loss": 0.751922070980072,
+ "eval_mean_token_accuracy": 0.8521237577809844,
+ "eval_num_tokens": 6442821.0,
+ "eval_runtime": 86.3618,
+ "eval_samples_per_second": 15.921,
+ "eval_steps_per_second": 1.992,
+ "step": 2760
+ },
+ {
+ "entropy": 0.1518704930320382,
+ "epoch": 6.916562889165629,
+ "grad_norm": 0.5201290249824524,
+ "learning_rate": 5.957332590312513e-05,
+ "loss": 0.09010660648345947,
+ "mean_token_accuracy": 0.9693463340401649,
+ "num_tokens": 6494118.0,
+ "step": 2780
+ },
+ {
+ "epoch": 6.916562889165629,
+ "eval_entropy": 0.28485129617674404,
+ "eval_loss": 0.7452457547187805,
+ "eval_mean_token_accuracy": 0.8512036796919135,
+ "eval_num_tokens": 6494118.0,
+ "eval_runtime": 86.4524,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2780
+ },
+ {
+ "entropy": 0.15512610590085388,
+ "epoch": 6.966376089663761,
+ "grad_norm": 0.42802050709724426,
+ "learning_rate": 5.785082532465233e-05,
+ "loss": 0.09320432543754578,
+ "mean_token_accuracy": 0.9686134628951549,
+ "num_tokens": 6540175.0,
+ "step": 2800
+ },
+ {
+ "epoch": 6.966376089663761,
+ "eval_entropy": 0.27554594526110693,
+ "eval_loss": 0.7644653916358948,
+ "eval_mean_token_accuracy": 0.8513738523389018,
+ "eval_num_tokens": 6540175.0,
+ "eval_runtime": 85.7609,
+ "eval_samples_per_second": 16.033,
+ "eval_steps_per_second": 2.006,
+ "step": 2800
+ },
+ {
+ "entropy": 0.17524497526196334,
+ "epoch": 7.01494396014944,
+ "grad_norm": 0.3330269157886505,
+ "learning_rate": 5.6144999125263545e-05,
+ "loss": 0.0895616888999939,
+ "mean_token_accuracy": 0.9682766932707566,
+ "num_tokens": 6583767.0,
+ "step": 2820
+ },
+ {
+ "epoch": 7.01494396014944,
+ "eval_entropy": 0.2735865569218647,
+ "eval_loss": 0.768479585647583,
+ "eval_mean_token_accuracy": 0.8503459383581959,
+ "eval_num_tokens": 6583767.0,
+ "eval_runtime": 85.7162,
+ "eval_samples_per_second": 16.041,
+ "eval_steps_per_second": 2.007,
+ "step": 2820
+ },
+ {
+ "entropy": 0.1403565663844347,
+ "epoch": 7.064757160647572,
+ "grad_norm": 0.35613498091697693,
+ "learning_rate": 5.4456361758874235e-05,
+ "loss": 0.07551313638687134,
+ "mean_token_accuracy": 0.9739301167428493,
+ "num_tokens": 6627672.0,
+ "step": 2840
+ },
+ {
+ "epoch": 7.064757160647572,
+ "eval_entropy": 0.25941789089593775,
+ "eval_loss": 0.8209511637687683,
+ "eval_mean_token_accuracy": 0.8505055855873019,
+ "eval_num_tokens": 6627672.0,
+ "eval_runtime": 86.0943,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 2840
+ },
+ {
+ "entropy": 0.13500106502324344,
+ "epoch": 7.114570361145703,
+ "grad_norm": 0.34418627619743347,
+ "learning_rate": 5.2785422495482234e-05,
+ "loss": 0.07293946146965027,
+ "mean_token_accuracy": 0.9747208289802074,
+ "num_tokens": 6672946.0,
+ "step": 2860
+ },
+ {
+ "epoch": 7.114570361145703,
+ "eval_entropy": 0.26482899772912954,
+ "eval_loss": 0.798904538154602,
+ "eval_mean_token_accuracy": 0.8511530233677044,
+ "eval_num_tokens": 6672946.0,
+ "eval_runtime": 85.7915,
+ "eval_samples_per_second": 16.027,
+ "eval_steps_per_second": 2.005,
+ "step": 2860
+ },
+ {
+ "entropy": 0.13127502552233636,
+ "epoch": 7.164383561643835,
+ "grad_norm": 0.4638441503047943,
+ "learning_rate": 5.113268526757892e-05,
+ "loss": 0.07121461629867554,
+ "mean_token_accuracy": 0.9756786689162255,
+ "num_tokens": 6718582.0,
+ "step": 2880
+ },
+ {
+ "epoch": 7.164383561643835,
+ "eval_entropy": 0.2645381211714689,
+ "eval_loss": 0.809101939201355,
+ "eval_mean_token_accuracy": 0.8514727898115335,
+ "eval_num_tokens": 6718582.0,
+ "eval_runtime": 85.84,
+ "eval_samples_per_second": 16.018,
+ "eval_steps_per_second": 2.004,
+ "step": 2880
+ },
+ {
+ "entropy": 0.1331390908919275,
+ "epoch": 7.214196762141968,
+ "grad_norm": 0.40206775069236755,
+ "learning_rate": 4.949864851817007e-05,
+ "loss": 0.07188264131546021,
+ "mean_token_accuracy": 0.9755406074225903,
+ "num_tokens": 6764387.0,
+ "step": 2900
+ },
+ {
+ "epoch": 7.214196762141968,
+ "eval_entropy": 0.26244733283339544,
+ "eval_loss": 0.8143188953399658,
+ "eval_mean_token_accuracy": 0.8514358189909957,
+ "eval_num_tokens": 6764387.0,
+ "eval_runtime": 85.8546,
+ "eval_samples_per_second": 16.015,
+ "eval_steps_per_second": 2.003,
+ "step": 2900
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.8524246689629594e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2920/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2920/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2920/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2920/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2920/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2920/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2920/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2920/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2920/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2920/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2920/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2920/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2920/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2920/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..a418ac6cb818cfa8a16e113e5cf0e006143894a5
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2920/trainer_state.json
@@ -0,0 +1,3100 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 7.2640099626401,
+ "eval_steps": 20,
+ "global_step": 2920,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ },
+ {
+ "entropy": 0.3193941755220294,
+ "epoch": 4.5280199252802,
+ "grad_norm": 0.8281906843185425,
+ "learning_rate": 0.0001509111761786888,
+ "loss": 0.23936262130737304,
+ "mean_token_accuracy": 0.9201708927750587,
+ "num_tokens": 4244423.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.5280199252802,
+ "eval_entropy": 0.38704028864239537,
+ "eval_loss": 0.6006569266319275,
+ "eval_mean_token_accuracy": 0.8502406720505205,
+ "eval_num_tokens": 4244423.0,
+ "eval_runtime": 86.8059,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1820
+ },
+ {
+ "entropy": 0.3164879363030195,
+ "epoch": 4.577833125778331,
+ "grad_norm": 0.7892968654632568,
+ "learning_rate": 0.00014905346557909867,
+ "loss": 0.24541733264923096,
+ "mean_token_accuracy": 0.9175932116806507,
+ "num_tokens": 4289773.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.577833125778331,
+ "eval_entropy": 0.38861122120951497,
+ "eval_loss": 0.6115967631340027,
+ "eval_mean_token_accuracy": 0.849471275196519,
+ "eval_num_tokens": 4289773.0,
+ "eval_runtime": 86.2946,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1840
+ },
+ {
+ "entropy": 0.3051785985007882,
+ "epoch": 4.627646326276463,
+ "grad_norm": 0.8109654188156128,
+ "learning_rate": 0.0001471849238862319,
+ "loss": 0.23433220386505127,
+ "mean_token_accuracy": 0.9206570319831371,
+ "num_tokens": 4336894.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.627646326276463,
+ "eval_entropy": 0.37162452295076015,
+ "eval_loss": 0.6184061765670776,
+ "eval_mean_token_accuracy": 0.8501173268223918,
+ "eval_num_tokens": 4336894.0,
+ "eval_runtime": 86.6865,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1860
+ },
+ {
+ "entropy": 0.3168198253959417,
+ "epoch": 4.677459526774595,
+ "grad_norm": 0.9512342214584351,
+ "learning_rate": 0.0001453061146267775,
+ "loss": 0.23832404613494873,
+ "mean_token_accuracy": 0.9197044663131237,
+ "num_tokens": 4382947.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.677459526774595,
+ "eval_entropy": 0.3845940856912801,
+ "eval_loss": 0.606762707233429,
+ "eval_mean_token_accuracy": 0.8504838194957999,
+ "eval_num_tokens": 4382947.0,
+ "eval_runtime": 86.5175,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 1880
+ },
+ {
+ "entropy": 0.30791807882487776,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 0.8123113512992859,
+ "learning_rate": 0.00014341760442398248,
+ "loss": 0.2395785331726074,
+ "mean_token_accuracy": 0.918928150832653,
+ "num_tokens": 4433050.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.7272727272727275,
+ "eval_entropy": 0.39762327222283494,
+ "eval_loss": 0.5994202494621277,
+ "eval_mean_token_accuracy": 0.8509274201337681,
+ "eval_num_tokens": 4433050.0,
+ "eval_runtime": 86.2873,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.993,
+ "step": 1900
+ },
+ {
+ "entropy": 0.3021434534341097,
+ "epoch": 4.777085927770859,
+ "grad_norm": 0.731787383556366,
+ "learning_rate": 0.000141519962826766,
+ "loss": 0.23494718074798585,
+ "mean_token_accuracy": 0.9201403826475143,
+ "num_tokens": 4483598.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.777085927770859,
+ "eval_entropy": 0.3827026732439219,
+ "eval_loss": 0.5995895862579346,
+ "eval_mean_token_accuracy": 0.851468373523202,
+ "eval_num_tokens": 4483598.0,
+ "eval_runtime": 86.3006,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 1920
+ },
+ {
+ "entropy": 0.31626159623265265,
+ "epoch": 4.826899128268991,
+ "grad_norm": 0.8848487138748169,
+ "learning_rate": 0.00013961376213795132,
+ "loss": 0.2439030647277832,
+ "mean_token_accuracy": 0.9196575872600079,
+ "num_tokens": 4529201.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.826899128268991,
+ "eval_entropy": 0.388698436839636,
+ "eval_loss": 0.6000174283981323,
+ "eval_mean_token_accuracy": 0.8518068187458571,
+ "eval_num_tokens": 4529201.0,
+ "eval_runtime": 86.8979,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.979,
+ "step": 1940
+ },
+ {
+ "entropy": 0.30520407035946845,
+ "epoch": 4.876712328767123,
+ "grad_norm": 0.8532460927963257,
+ "learning_rate": 0.00013769957724166695,
+ "loss": 0.23458616733551024,
+ "mean_token_accuracy": 0.9221912942826748,
+ "num_tokens": 4578167.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.876712328767123,
+ "eval_entropy": 0.38777847102908203,
+ "eval_loss": 0.6004981398582458,
+ "eval_mean_token_accuracy": 0.8516481768253238,
+ "eval_num_tokens": 4578167.0,
+ "eval_runtime": 87.0777,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.975,
+ "step": 1960
+ },
+ {
+ "entropy": 0.3226448342204094,
+ "epoch": 4.926525529265255,
+ "grad_norm": 0.6945561766624451,
+ "learning_rate": 0.0001357779854299694,
+ "loss": 0.24048397541046143,
+ "mean_token_accuracy": 0.9195300146937371,
+ "num_tokens": 4622316.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.926525529265255,
+ "eval_entropy": 0.38581624263247777,
+ "eval_loss": 0.6029234528541565,
+ "eval_mean_token_accuracy": 0.8514213260523108,
+ "eval_num_tokens": 4622316.0,
+ "eval_runtime": 85.8729,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 1980
+ },
+ {
+ "entropy": 0.3051655298098922,
+ "epoch": 4.976338729763388,
+ "grad_norm": 0.7976452708244324,
+ "learning_rate": 0.00013384956622874001,
+ "loss": 0.23584742546081544,
+ "mean_token_accuracy": 0.9216851457953453,
+ "num_tokens": 4670746.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.976338729763388,
+ "eval_entropy": 0.37913159246361533,
+ "eval_loss": 0.6057604551315308,
+ "eval_mean_token_accuracy": 0.8525801203971686,
+ "eval_num_tokens": 4670746.0,
+ "eval_runtime": 86.1145,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2000
+ },
+ {
+ "entropy": 0.27438195240803254,
+ "epoch": 5.024906600249066,
+ "grad_norm": 0.6729586124420166,
+ "learning_rate": 0.0001319149012229075,
+ "loss": 0.19775952100753785,
+ "mean_token_accuracy": 0.9339428559327737,
+ "num_tokens": 4716176.0,
+ "step": 2020
+ },
+ {
+ "epoch": 5.024906600249066,
+ "eval_entropy": 0.3448961910813354,
+ "eval_loss": 0.6750120520591736,
+ "eval_mean_token_accuracy": 0.8487970232963562,
+ "eval_num_tokens": 4716176.0,
+ "eval_runtime": 86.1169,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2020
+ },
+ {
+ "entropy": 0.21423916313797237,
+ "epoch": 5.074719800747198,
+ "grad_norm": 0.6934391856193542,
+ "learning_rate": 0.00012997457388105022,
+ "loss": 0.1439570426940918,
+ "mean_token_accuracy": 0.9528236843645572,
+ "num_tokens": 4763269.0,
+ "step": 2040
+ },
+ {
+ "epoch": 5.074719800747198,
+ "eval_entropy": 0.3570949243771475,
+ "eval_loss": 0.6465504169464111,
+ "eval_mean_token_accuracy": 0.8490785547467166,
+ "eval_num_tokens": 4763269.0,
+ "eval_runtime": 85.9574,
+ "eval_samples_per_second": 15.996,
+ "eval_steps_per_second": 2.001,
+ "step": 2040
+ },
+ {
+ "entropy": 0.20838565267622472,
+ "epoch": 5.12453300124533,
+ "grad_norm": 0.7286986112594604,
+ "learning_rate": 0.00012802916937942972,
+ "loss": 0.14467307329177856,
+ "mean_token_accuracy": 0.950994835793972,
+ "num_tokens": 4809047.0,
+ "step": 2060
+ },
+ {
+ "epoch": 5.12453300124533,
+ "eval_entropy": 0.3452463157821533,
+ "eval_loss": 0.6705958843231201,
+ "eval_mean_token_accuracy": 0.8490352796953778,
+ "eval_num_tokens": 4809047.0,
+ "eval_runtime": 86.228,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 2060
+ },
+ {
+ "entropy": 0.20453082229942082,
+ "epoch": 5.174346201743462,
+ "grad_norm": 0.7515555620193481,
+ "learning_rate": 0.00012607927442550974,
+ "loss": 0.13732000589370727,
+ "mean_token_accuracy": 0.9537357829511166,
+ "num_tokens": 4857965.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.174346201743462,
+ "eval_entropy": 0.32431264914745506,
+ "eval_loss": 0.6743043065071106,
+ "eval_mean_token_accuracy": 0.8504878629085629,
+ "eval_num_tokens": 4857965.0,
+ "eval_runtime": 86.5948,
+ "eval_samples_per_second": 15.879,
+ "eval_steps_per_second": 1.986,
+ "step": 2080
+ },
+ {
+ "entropy": 0.21812320686876774,
+ "epoch": 5.224159402241594,
+ "grad_norm": 0.9093465209007263,
+ "learning_rate": 0.0001241254770810132,
+ "loss": 0.14311420917510986,
+ "mean_token_accuracy": 0.9514068141579628,
+ "num_tokens": 4905151.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.224159402241594,
+ "eval_entropy": 0.33086285835435225,
+ "eval_loss": 0.6676449179649353,
+ "eval_mean_token_accuracy": 0.8505287662495015,
+ "eval_num_tokens": 4905151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 2100
+ },
+ {
+ "entropy": 0.2180163251236081,
+ "epoch": 5.273972602739726,
+ "grad_norm": 0.6703007221221924,
+ "learning_rate": 0.00012216836658457075,
+ "loss": 0.14803968667984008,
+ "mean_token_accuracy": 0.9521303348243236,
+ "num_tokens": 4947072.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.273972602739726,
+ "eval_entropy": 0.33162341708707255,
+ "eval_loss": 0.6658875942230225,
+ "eval_mean_token_accuracy": 0.8500757605530495,
+ "eval_num_tokens": 4947072.0,
+ "eval_runtime": 86.6296,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 2120
+ },
+ {
+ "entropy": 0.22511130161583423,
+ "epoch": 5.323785803237858,
+ "grad_norm": 0.8078880906105042,
+ "learning_rate": 0.00012020853317401455,
+ "loss": 0.15228408575057983,
+ "mean_token_accuracy": 0.947144789993763,
+ "num_tokens": 4991974.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.323785803237858,
+ "eval_entropy": 0.3354601170434508,
+ "eval_loss": 0.6677829623222351,
+ "eval_mean_token_accuracy": 0.8482600024273229,
+ "eval_num_tokens": 4991974.0,
+ "eval_runtime": 86.4689,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.989,
+ "step": 2140
+ },
+ {
+ "entropy": 0.2244176059961319,
+ "epoch": 5.37359900373599,
+ "grad_norm": 0.9636075496673584,
+ "learning_rate": 0.00011824656790837037,
+ "loss": 0.15260883569717407,
+ "mean_token_accuracy": 0.9471467643976211,
+ "num_tokens": 5038400.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.37359900373599,
+ "eval_entropy": 0.3381616926297199,
+ "eval_loss": 0.6694412231445312,
+ "eval_mean_token_accuracy": 0.8482369603805764,
+ "eval_num_tokens": 5038400.0,
+ "eval_runtime": 86.4147,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 2160
+ },
+ {
+ "entropy": 0.22982364390045404,
+ "epoch": 5.423412204234122,
+ "grad_norm": 0.775401771068573,
+ "learning_rate": 0.00011628306248960262,
+ "loss": 0.15140302181243898,
+ "mean_token_accuracy": 0.9492553934454918,
+ "num_tokens": 5083166.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.423412204234122,
+ "eval_entropy": 0.3305150235808173,
+ "eval_loss": 0.6717822551727295,
+ "eval_mean_token_accuracy": 0.8489849723355715,
+ "eval_num_tokens": 5083166.0,
+ "eval_runtime": 86.4728,
+ "eval_samples_per_second": 15.901,
+ "eval_steps_per_second": 1.989,
+ "step": 2180
+ },
+ {
+ "entropy": 0.21448935717344284,
+ "epoch": 5.473225404732254,
+ "grad_norm": 0.6575281023979187,
+ "learning_rate": 0.00011431860908416465,
+ "loss": 0.1452319622039795,
+ "mean_token_accuracy": 0.9505287684500218,
+ "num_tokens": 5135109.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.473225404732254,
+ "eval_entropy": 0.3488145174328671,
+ "eval_loss": 0.6612305641174316,
+ "eval_mean_token_accuracy": 0.8492907808963642,
+ "eval_num_tokens": 5135109.0,
+ "eval_runtime": 86.6927,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 2200
+ },
+ {
+ "entropy": 0.23091202937066554,
+ "epoch": 5.523038605230386,
+ "grad_norm": 0.8909686207771301,
+ "learning_rate": 0.00011235380014440985,
+ "loss": 0.15150139331817628,
+ "mean_token_accuracy": 0.9497875183820724,
+ "num_tokens": 5180138.0,
+ "step": 2220
+ },
+ {
+ "epoch": 5.523038605230386,
+ "eval_entropy": 0.3268539015810157,
+ "eval_loss": 0.6667542457580566,
+ "eval_mean_token_accuracy": 0.8499062903398691,
+ "eval_num_tokens": 5180138.0,
+ "eval_runtime": 86.4644,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 2220
+ },
+ {
+ "entropy": 0.2227974807843566,
+ "epoch": 5.572851805728518,
+ "grad_norm": 0.6180275082588196,
+ "learning_rate": 0.0001103892282299158,
+ "loss": 0.1491069197654724,
+ "mean_token_accuracy": 0.9488144010305405,
+ "num_tokens": 5226864.0,
+ "step": 2240
+ },
+ {
+ "epoch": 5.572851805728518,
+ "eval_entropy": 0.3346347655494546,
+ "eval_loss": 0.6665948629379272,
+ "eval_mean_token_accuracy": 0.8499961893918903,
+ "eval_num_tokens": 5226864.0,
+ "eval_runtime": 87.0548,
+ "eval_samples_per_second": 15.795,
+ "eval_steps_per_second": 1.976,
+ "step": 2240
+ },
+ {
+ "entropy": 0.21368421968072654,
+ "epoch": 5.62266500622665,
+ "grad_norm": 0.6004369258880615,
+ "learning_rate": 0.00010842548582877651,
+ "loss": 0.14485255479812623,
+ "mean_token_accuracy": 0.9502056457102299,
+ "num_tokens": 5276602.0,
+ "step": 2260
+ },
+ {
+ "epoch": 5.62266500622665,
+ "eval_entropy": 0.32753298804163933,
+ "eval_loss": 0.6680151224136353,
+ "eval_mean_token_accuracy": 0.8515451086121936,
+ "eval_num_tokens": 5276602.0,
+ "eval_runtime": 86.8524,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.98,
+ "step": 2260
+ },
+ {
+ "entropy": 0.2103635374456644,
+ "epoch": 5.672478206724782,
+ "grad_norm": 0.699174702167511,
+ "learning_rate": 0.00010646316517891613,
+ "loss": 0.14297772645950318,
+ "mean_token_accuracy": 0.9512537539005279,
+ "num_tokens": 5323718.0,
+ "step": 2280
+ },
+ {
+ "epoch": 5.672478206724782,
+ "eval_entropy": 0.32966585959806,
+ "eval_loss": 0.675578773021698,
+ "eval_mean_token_accuracy": 0.8509623023659684,
+ "eval_num_tokens": 5323718.0,
+ "eval_runtime": 86.4518,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2280
+ },
+ {
+ "entropy": 0.22516900151968003,
+ "epoch": 5.722291407222914,
+ "grad_norm": 0.6637354493141174,
+ "learning_rate": 0.00010450285808947797,
+ "loss": 0.15202572345733642,
+ "mean_token_accuracy": 0.9482452072203159,
+ "num_tokens": 5369039.0,
+ "step": 2300
+ },
+ {
+ "epoch": 5.722291407222914,
+ "eval_entropy": 0.3369456917740578,
+ "eval_loss": 0.6697061061859131,
+ "eval_mean_token_accuracy": 0.848603522361711,
+ "eval_num_tokens": 5369039.0,
+ "eval_runtime": 86.6371,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.985,
+ "step": 2300
+ },
+ {
+ "entropy": 0.21841065725311637,
+ "epoch": 5.772104607721046,
+ "grad_norm": 0.7940268516540527,
+ "learning_rate": 0.00010254515576234297,
+ "loss": 0.14710167646408082,
+ "mean_token_accuracy": 0.9493498183786869,
+ "num_tokens": 5417029.0,
+ "step": 2320
+ },
+ {
+ "epoch": 5.772104607721046,
+ "eval_entropy": 0.3237486180177955,
+ "eval_loss": 0.6779657602310181,
+ "eval_mean_token_accuracy": 0.8500715313955794,
+ "eval_num_tokens": 5417029.0,
+ "eval_runtime": 86.1826,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 1.996,
+ "step": 2320
+ },
+ {
+ "entropy": 0.22146204356104135,
+ "epoch": 5.821917808219178,
+ "grad_norm": 0.9234833121299744,
+ "learning_rate": 0.00010059064861383132,
+ "loss": 0.14720046520233154,
+ "mean_token_accuracy": 0.9493872679769992,
+ "num_tokens": 5461671.0,
+ "step": 2340
+ },
+ {
+ "epoch": 5.821917808219178,
+ "eval_entropy": 0.32365207564692167,
+ "eval_loss": 0.6704005002975464,
+ "eval_mean_token_accuracy": 0.8507985760306203,
+ "eval_num_tokens": 5461671.0,
+ "eval_runtime": 86.5494,
+ "eval_samples_per_second": 15.887,
+ "eval_steps_per_second": 1.987,
+ "step": 2340
+ },
+ {
+ "entropy": 0.20934011954814197,
+ "epoch": 5.87173100871731,
+ "grad_norm": 0.5547503232955933,
+ "learning_rate": 9.863992609664084e-05,
+ "loss": 0.1464867353439331,
+ "mean_token_accuracy": 0.9503875687718392,
+ "num_tokens": 5509312.0,
+ "step": 2360
+ },
+ {
+ "epoch": 5.87173100871731,
+ "eval_entropy": 0.3330401429083458,
+ "eval_loss": 0.6659091114997864,
+ "eval_mean_token_accuracy": 0.8504848906467127,
+ "eval_num_tokens": 5509312.0,
+ "eval_runtime": 86.5855,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 2360
+ },
+ {
+ "entropy": 0.21678635366261007,
+ "epoch": 5.921544209215442,
+ "grad_norm": 0.570612907409668,
+ "learning_rate": 9.669357652207635e-05,
+ "loss": 0.14821385145187377,
+ "mean_token_accuracy": 0.9503940217196941,
+ "num_tokens": 5558196.0,
+ "step": 2380
+ },
+ {
+ "epoch": 5.921544209215442,
+ "eval_entropy": 0.3322022325077722,
+ "eval_loss": 0.6722489595413208,
+ "eval_mean_token_accuracy": 0.8489979422369669,
+ "eval_num_tokens": 5558196.0,
+ "eval_runtime": 86.2986,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 2380
+ },
+ {
+ "entropy": 0.20932920072227718,
+ "epoch": 5.971357409713574,
+ "grad_norm": 0.7879557609558105,
+ "learning_rate": 9.475218688262262e-05,
+ "loss": 0.14675841331481934,
+ "mean_token_accuracy": 0.9507176131010056,
+ "num_tokens": 5605400.0,
+ "step": 2400
+ },
+ {
+ "epoch": 5.971357409713574,
+ "eval_entropy": 0.3199348642902319,
+ "eval_loss": 0.6698136329650879,
+ "eval_mean_token_accuracy": 0.8514142130003419,
+ "eval_num_tokens": 5605400.0,
+ "eval_runtime": 85.8995,
+ "eval_samples_per_second": 16.007,
+ "eval_steps_per_second": 2.002,
+ "step": 2400
+ },
+ {
+ "entropy": 0.21032143919131693,
+ "epoch": 6.019925280199253,
+ "grad_norm": 0.5823076367378235,
+ "learning_rate": 9.281634267491569e-05,
+ "loss": 0.13322267532348633,
+ "mean_token_accuracy": 0.9550939072401096,
+ "num_tokens": 5648968.0,
+ "step": 2420
+ },
+ {
+ "epoch": 6.019925280199253,
+ "eval_entropy": 0.30206270117399303,
+ "eval_loss": 0.7093168497085571,
+ "eval_mean_token_accuracy": 0.8500627639681794,
+ "eval_num_tokens": 5648968.0,
+ "eval_runtime": 85.8128,
+ "eval_samples_per_second": 16.023,
+ "eval_steps_per_second": 2.004,
+ "step": 2420
+ },
+ {
+ "entropy": 0.1534628233872354,
+ "epoch": 6.069738480697385,
+ "grad_norm": 0.710133969783783,
+ "learning_rate": 9.088662772316508e-05,
+ "loss": 0.09078952670097351,
+ "mean_token_accuracy": 0.9678447999060154,
+ "num_tokens": 5697633.0,
+ "step": 2440
+ },
+ {
+ "epoch": 6.069738480697385,
+ "eval_entropy": 0.28208133101809857,
+ "eval_loss": 0.7636417150497437,
+ "eval_mean_token_accuracy": 0.8494061477655588,
+ "eval_num_tokens": 5697633.0,
+ "eval_runtime": 85.9724,
+ "eval_samples_per_second": 15.994,
+ "eval_steps_per_second": 2.001,
+ "step": 2440
+ },
+ {
+ "entropy": 0.16151462448760867,
+ "epoch": 6.119551681195516,
+ "grad_norm": 0.5793812274932861,
+ "learning_rate": 8.896362400308028e-05,
+ "loss": 0.09545697569847107,
+ "mean_token_accuracy": 0.9671573750674725,
+ "num_tokens": 5745090.0,
+ "step": 2460
+ },
+ {
+ "epoch": 6.119551681195516,
+ "eval_entropy": 0.2833245605403601,
+ "eval_loss": 0.7402405738830566,
+ "eval_mean_token_accuracy": 0.8503523728875226,
+ "eval_num_tokens": 5745090.0,
+ "eval_runtime": 85.5461,
+ "eval_samples_per_second": 16.073,
+ "eval_steps_per_second": 2.011,
+ "step": 2460
+ },
+ {
+ "entropy": 0.15203177919611335,
+ "epoch": 6.169364881693649,
+ "grad_norm": 0.4251123368740082,
+ "learning_rate": 8.704791146635483e-05,
+ "loss": 0.09420782327651978,
+ "mean_token_accuracy": 0.9677386932075024,
+ "num_tokens": 5790333.0,
+ "step": 2480
+ },
+ {
+ "epoch": 6.169364881693649,
+ "eval_entropy": 0.28572545962971313,
+ "eval_loss": 0.735416829586029,
+ "eval_mean_token_accuracy": 0.8487084663884584,
+ "eval_num_tokens": 5790333.0,
+ "eval_runtime": 85.4801,
+ "eval_samples_per_second": 16.086,
+ "eval_steps_per_second": 2.012,
+ "step": 2480
+ },
+ {
+ "entropy": 0.15587336672469973,
+ "epoch": 6.219178082191781,
+ "grad_norm": 0.4357028007507324,
+ "learning_rate": 8.514006786576085e-05,
+ "loss": 0.09429320096969604,
+ "mean_token_accuracy": 0.9682952925562859,
+ "num_tokens": 5837321.0,
+ "step": 2500
+ },
+ {
+ "epoch": 6.219178082191781,
+ "eval_entropy": 0.2859006894882335,
+ "eval_loss": 0.7347224950790405,
+ "eval_mean_token_accuracy": 0.8501905518215757,
+ "eval_num_tokens": 5837321.0,
+ "eval_runtime": 85.7578,
+ "eval_samples_per_second": 16.034,
+ "eval_steps_per_second": 2.006,
+ "step": 2500
+ },
+ {
+ "entropy": 0.15765639198943973,
+ "epoch": 6.268991282689913,
+ "grad_norm": 0.47331130504608154,
+ "learning_rate": 8.324066858090663e-05,
+ "loss": 0.09571113586425781,
+ "mean_token_accuracy": 0.9683481335639954,
+ "num_tokens": 5884398.0,
+ "step": 2520
+ },
+ {
+ "epoch": 6.268991282689913,
+ "eval_entropy": 0.29231513846059176,
+ "eval_loss": 0.7392512559890747,
+ "eval_mean_token_accuracy": 0.8486633983462356,
+ "eval_num_tokens": 5884398.0,
+ "eval_runtime": 85.7846,
+ "eval_samples_per_second": 16.029,
+ "eval_steps_per_second": 2.005,
+ "step": 2520
+ },
+ {
+ "entropy": 0.16176860257983208,
+ "epoch": 6.318804483188045,
+ "grad_norm": 0.6142018437385559,
+ "learning_rate": 8.135028644470992e-05,
+ "loss": 0.09486144185066223,
+ "mean_token_accuracy": 0.9682316601276397,
+ "num_tokens": 5929876.0,
+ "step": 2540
+ },
+ {
+ "epoch": 6.318804483188045,
+ "eval_entropy": 0.2851274753379267,
+ "eval_loss": 0.7520816922187805,
+ "eval_mean_token_accuracy": 0.8501113649717597,
+ "eval_num_tokens": 5929876.0,
+ "eval_runtime": 85.9425,
+ "eval_samples_per_second": 15.999,
+ "eval_steps_per_second": 2.001,
+ "step": 2540
+ },
+ {
+ "entropy": 0.15404034564271568,
+ "epoch": 6.3686176836861765,
+ "grad_norm": 0.6051287651062012,
+ "learning_rate": 7.946949157063964e-05,
+ "loss": 0.09280472993850708,
+ "mean_token_accuracy": 0.9684635892510414,
+ "num_tokens": 5978490.0,
+ "step": 2560
+ },
+ {
+ "epoch": 6.3686176836861765,
+ "eval_entropy": 0.28802703563557114,
+ "eval_loss": 0.7439162135124207,
+ "eval_mean_token_accuracy": 0.8499851770872293,
+ "eval_num_tokens": 5978490.0,
+ "eval_runtime": 86.0703,
+ "eval_samples_per_second": 15.975,
+ "eval_steps_per_second": 1.998,
+ "step": 2560
+ },
+ {
+ "entropy": 0.15343588953837753,
+ "epoch": 6.418430884184309,
+ "grad_norm": 0.4823743402957916,
+ "learning_rate": 7.759885118077701e-05,
+ "loss": 0.09000591039657593,
+ "mean_token_accuracy": 0.9699928767979145,
+ "num_tokens": 6025380.0,
+ "step": 2580
+ },
+ {
+ "epoch": 6.418430884184309,
+ "eval_entropy": 0.2795634938533916,
+ "eval_loss": 0.7647850513458252,
+ "eval_mean_token_accuracy": 0.8503464397995971,
+ "eval_num_tokens": 6025380.0,
+ "eval_runtime": 85.8886,
+ "eval_samples_per_second": 16.009,
+ "eval_steps_per_second": 2.003,
+ "step": 2580
+ },
+ {
+ "entropy": 0.15740026142448188,
+ "epoch": 6.468244084682441,
+ "grad_norm": 0.5082696676254272,
+ "learning_rate": 7.57389294347494e-05,
+ "loss": 0.09191849827766418,
+ "mean_token_accuracy": 0.9692809768021107,
+ "num_tokens": 6073349.0,
+ "step": 2600
+ },
+ {
+ "epoch": 6.468244084682441,
+ "eval_entropy": 0.2913342311458532,
+ "eval_loss": 0.7518694996833801,
+ "eval_mean_token_accuracy": 0.8483168302580367,
+ "eval_num_tokens": 6073349.0,
+ "eval_runtime": 85.5761,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.01,
+ "step": 2600
+ },
+ {
+ "entropy": 0.15922069251537324,
+ "epoch": 6.518057285180573,
+ "grad_norm": 0.3995199501514435,
+ "learning_rate": 7.389028725958736e-05,
+ "loss": 0.09584367871284485,
+ "mean_token_accuracy": 0.9685114495456218,
+ "num_tokens": 6118148.0,
+ "step": 2620
+ },
+ {
+ "epoch": 6.518057285180573,
+ "eval_entropy": 0.2863075934177221,
+ "eval_loss": 0.7539381384849548,
+ "eval_mean_token_accuracy": 0.8507507083027862,
+ "eval_num_tokens": 6118148.0,
+ "eval_runtime": 86.112,
+ "eval_samples_per_second": 15.968,
+ "eval_steps_per_second": 1.997,
+ "step": 2620
+ },
+ {
+ "entropy": 0.16197575423866512,
+ "epoch": 6.567870485678705,
+ "grad_norm": 0.534295380115509,
+ "learning_rate": 7.205348218055678e-05,
+ "loss": 0.0961170256137848,
+ "mean_token_accuracy": 0.9674530044198036,
+ "num_tokens": 6165523.0,
+ "step": 2640
+ },
+ {
+ "epoch": 6.567870485678705,
+ "eval_entropy": 0.29021967315050057,
+ "eval_loss": 0.751198947429657,
+ "eval_mean_token_accuracy": 0.8509796344956686,
+ "eval_num_tokens": 6165523.0,
+ "eval_runtime": 85.7958,
+ "eval_samples_per_second": 16.026,
+ "eval_steps_per_second": 2.005,
+ "step": 2640
+ },
+ {
+ "entropy": 0.15261746793985367,
+ "epoch": 6.617683686176837,
+ "grad_norm": 0.5391237139701843,
+ "learning_rate": 7.022906815301673e-05,
+ "loss": 0.0926026999950409,
+ "mean_token_accuracy": 0.9695659473538398,
+ "num_tokens": 6216232.0,
+ "step": 2660
+ },
+ {
+ "epoch": 6.617683686176837,
+ "eval_entropy": 0.29128045216202736,
+ "eval_loss": 0.7450292110443115,
+ "eval_mean_token_accuracy": 0.8498771443616512,
+ "eval_num_tokens": 6216232.0,
+ "eval_runtime": 86.3963,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 2660
+ },
+ {
+ "entropy": 0.16164180357009172,
+ "epoch": 6.667496886674969,
+ "grad_norm": 0.5767946243286133,
+ "learning_rate": 6.841759539535419e-05,
+ "loss": 0.09291981458663941,
+ "mean_token_accuracy": 0.9687136687338352,
+ "num_tokens": 6264807.0,
+ "step": 2680
+ },
+ {
+ "epoch": 6.667496886674969,
+ "eval_entropy": 0.2897637223088464,
+ "eval_loss": 0.7503410577774048,
+ "eval_mean_token_accuracy": 0.8503315164599308,
+ "eval_num_tokens": 6264807.0,
+ "eval_runtime": 86.0653,
+ "eval_samples_per_second": 15.976,
+ "eval_steps_per_second": 1.998,
+ "step": 2680
+ },
+ {
+ "entropy": 0.17062523355707526,
+ "epoch": 6.717310087173101,
+ "grad_norm": 0.4974168539047241,
+ "learning_rate": 6.661961022304563e-05,
+ "loss": 0.09713236689567566,
+ "mean_token_accuracy": 0.9661971725523472,
+ "num_tokens": 6308819.0,
+ "step": 2700
+ },
+ {
+ "epoch": 6.717310087173101,
+ "eval_entropy": 0.2765843396963075,
+ "eval_loss": 0.7604002356529236,
+ "eval_mean_token_accuracy": 0.8521115277395692,
+ "eval_num_tokens": 6308819.0,
+ "eval_runtime": 86.1676,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 2700
+ },
+ {
+ "entropy": 0.17544092936441302,
+ "epoch": 6.767123287671232,
+ "grad_norm": 0.5523537993431091,
+ "learning_rate": 6.483565488389582e-05,
+ "loss": 0.09709116220474243,
+ "mean_token_accuracy": 0.9650957375764847,
+ "num_tokens": 6352548.0,
+ "step": 2720
+ },
+ {
+ "epoch": 6.767123287671232,
+ "eval_entropy": 0.27939334659035814,
+ "eval_loss": 0.7534670829772949,
+ "eval_mean_token_accuracy": 0.851230604010959,
+ "eval_num_tokens": 6352548.0,
+ "eval_runtime": 86.2913,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 2720
+ },
+ {
+ "entropy": 0.15991022661328316,
+ "epoch": 6.816936488169365,
+ "grad_norm": 0.478551983833313,
+ "learning_rate": 6.306626739450311e-05,
+ "loss": 0.09564646482467651,
+ "mean_token_accuracy": 0.9679084822535515,
+ "num_tokens": 6397720.0,
+ "step": 2740
+ },
+ {
+ "epoch": 6.816936488169365,
+ "eval_entropy": 0.27878295491601146,
+ "eval_loss": 0.7519959211349487,
+ "eval_mean_token_accuracy": 0.8510654949864676,
+ "eval_num_tokens": 6397720.0,
+ "eval_runtime": 85.9109,
+ "eval_samples_per_second": 16.005,
+ "eval_steps_per_second": 2.002,
+ "step": 2740
+ },
+ {
+ "entropy": 0.16824879590421915,
+ "epoch": 6.866749688667497,
+ "grad_norm": 0.6681098937988281,
+ "learning_rate": 6.131198137800108e-05,
+ "loss": 0.0962279736995697,
+ "mean_token_accuracy": 0.966830012947321,
+ "num_tokens": 6442821.0,
+ "step": 2760
+ },
+ {
+ "epoch": 6.866749688667497,
+ "eval_entropy": 0.2834690434121808,
+ "eval_loss": 0.751922070980072,
+ "eval_mean_token_accuracy": 0.8521237577809844,
+ "eval_num_tokens": 6442821.0,
+ "eval_runtime": 86.3618,
+ "eval_samples_per_second": 15.921,
+ "eval_steps_per_second": 1.992,
+ "step": 2760
+ },
+ {
+ "entropy": 0.1518704930320382,
+ "epoch": 6.916562889165629,
+ "grad_norm": 0.5201290249824524,
+ "learning_rate": 5.957332590312513e-05,
+ "loss": 0.09010660648345947,
+ "mean_token_accuracy": 0.9693463340401649,
+ "num_tokens": 6494118.0,
+ "step": 2780
+ },
+ {
+ "epoch": 6.916562889165629,
+ "eval_entropy": 0.28485129617674404,
+ "eval_loss": 0.7452457547187805,
+ "eval_mean_token_accuracy": 0.8512036796919135,
+ "eval_num_tokens": 6494118.0,
+ "eval_runtime": 86.4524,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2780
+ },
+ {
+ "entropy": 0.15512610590085388,
+ "epoch": 6.966376089663761,
+ "grad_norm": 0.42802050709724426,
+ "learning_rate": 5.785082532465233e-05,
+ "loss": 0.09320432543754578,
+ "mean_token_accuracy": 0.9686134628951549,
+ "num_tokens": 6540175.0,
+ "step": 2800
+ },
+ {
+ "epoch": 6.966376089663761,
+ "eval_entropy": 0.27554594526110693,
+ "eval_loss": 0.7644653916358948,
+ "eval_mean_token_accuracy": 0.8513738523389018,
+ "eval_num_tokens": 6540175.0,
+ "eval_runtime": 85.7609,
+ "eval_samples_per_second": 16.033,
+ "eval_steps_per_second": 2.006,
+ "step": 2800
+ },
+ {
+ "entropy": 0.17524497526196334,
+ "epoch": 7.01494396014944,
+ "grad_norm": 0.3330269157886505,
+ "learning_rate": 5.6144999125263545e-05,
+ "loss": 0.0895616888999939,
+ "mean_token_accuracy": 0.9682766932707566,
+ "num_tokens": 6583767.0,
+ "step": 2820
+ },
+ {
+ "epoch": 7.01494396014944,
+ "eval_entropy": 0.2735865569218647,
+ "eval_loss": 0.768479585647583,
+ "eval_mean_token_accuracy": 0.8503459383581959,
+ "eval_num_tokens": 6583767.0,
+ "eval_runtime": 85.7162,
+ "eval_samples_per_second": 16.041,
+ "eval_steps_per_second": 2.007,
+ "step": 2820
+ },
+ {
+ "entropy": 0.1403565663844347,
+ "epoch": 7.064757160647572,
+ "grad_norm": 0.35613498091697693,
+ "learning_rate": 5.4456361758874235e-05,
+ "loss": 0.07551313638687134,
+ "mean_token_accuracy": 0.9739301167428493,
+ "num_tokens": 6627672.0,
+ "step": 2840
+ },
+ {
+ "epoch": 7.064757160647572,
+ "eval_entropy": 0.25941789089593775,
+ "eval_loss": 0.8209511637687683,
+ "eval_mean_token_accuracy": 0.8505055855873019,
+ "eval_num_tokens": 6627672.0,
+ "eval_runtime": 86.0943,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 2840
+ },
+ {
+ "entropy": 0.13500106502324344,
+ "epoch": 7.114570361145703,
+ "grad_norm": 0.34418627619743347,
+ "learning_rate": 5.2785422495482234e-05,
+ "loss": 0.07293946146965027,
+ "mean_token_accuracy": 0.9747208289802074,
+ "num_tokens": 6672946.0,
+ "step": 2860
+ },
+ {
+ "epoch": 7.114570361145703,
+ "eval_entropy": 0.26482899772912954,
+ "eval_loss": 0.798904538154602,
+ "eval_mean_token_accuracy": 0.8511530233677044,
+ "eval_num_tokens": 6672946.0,
+ "eval_runtime": 85.7915,
+ "eval_samples_per_second": 16.027,
+ "eval_steps_per_second": 2.005,
+ "step": 2860
+ },
+ {
+ "entropy": 0.13127502552233636,
+ "epoch": 7.164383561643835,
+ "grad_norm": 0.4638441503047943,
+ "learning_rate": 5.113268526757892e-05,
+ "loss": 0.07121461629867554,
+ "mean_token_accuracy": 0.9756786689162255,
+ "num_tokens": 6718582.0,
+ "step": 2880
+ },
+ {
+ "epoch": 7.164383561643835,
+ "eval_entropy": 0.2645381211714689,
+ "eval_loss": 0.809101939201355,
+ "eval_mean_token_accuracy": 0.8514727898115335,
+ "eval_num_tokens": 6718582.0,
+ "eval_runtime": 85.84,
+ "eval_samples_per_second": 16.018,
+ "eval_steps_per_second": 2.004,
+ "step": 2880
+ },
+ {
+ "entropy": 0.1331390908919275,
+ "epoch": 7.214196762141968,
+ "grad_norm": 0.40206775069236755,
+ "learning_rate": 4.949864851817007e-05,
+ "loss": 0.07188264131546021,
+ "mean_token_accuracy": 0.9755406074225903,
+ "num_tokens": 6764387.0,
+ "step": 2900
+ },
+ {
+ "epoch": 7.214196762141968,
+ "eval_entropy": 0.26244733283339544,
+ "eval_loss": 0.8143188953399658,
+ "eval_mean_token_accuracy": 0.8514358189909957,
+ "eval_num_tokens": 6764387.0,
+ "eval_runtime": 85.8546,
+ "eval_samples_per_second": 16.015,
+ "eval_steps_per_second": 2.003,
+ "step": 2900
+ },
+ {
+ "entropy": 0.13647331558167936,
+ "epoch": 7.2640099626401,
+ "grad_norm": 0.26405787467956543,
+ "learning_rate": 4.788380505045224e-05,
+ "loss": 0.07412450313568116,
+ "mean_token_accuracy": 0.9744274213910102,
+ "num_tokens": 6809678.0,
+ "step": 2920
+ },
+ {
+ "epoch": 7.2640099626401,
+ "eval_entropy": 0.2626111418182074,
+ "eval_loss": 0.8111525177955627,
+ "eval_mean_token_accuracy": 0.8512121695418691,
+ "eval_num_tokens": 6809678.0,
+ "eval_runtime": 85.9626,
+ "eval_samples_per_second": 15.995,
+ "eval_steps_per_second": 2.001,
+ "step": 2920
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.871313366429348e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2940/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2940/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2940/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2940/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2940/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2940/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2940/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2940/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2940/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2940/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2940/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2940/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2940/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2940/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..a4e4355a7c4e2056375d1367b6aaf2856b10cd41
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2940/trainer_state.json
@@ -0,0 +1,3121 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 7.313823163138232,
+ "eval_steps": 20,
+ "global_step": 2940,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ },
+ {
+ "entropy": 0.3193941755220294,
+ "epoch": 4.5280199252802,
+ "grad_norm": 0.8281906843185425,
+ "learning_rate": 0.0001509111761786888,
+ "loss": 0.23936262130737304,
+ "mean_token_accuracy": 0.9201708927750587,
+ "num_tokens": 4244423.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.5280199252802,
+ "eval_entropy": 0.38704028864239537,
+ "eval_loss": 0.6006569266319275,
+ "eval_mean_token_accuracy": 0.8502406720505205,
+ "eval_num_tokens": 4244423.0,
+ "eval_runtime": 86.8059,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1820
+ },
+ {
+ "entropy": 0.3164879363030195,
+ "epoch": 4.577833125778331,
+ "grad_norm": 0.7892968654632568,
+ "learning_rate": 0.00014905346557909867,
+ "loss": 0.24541733264923096,
+ "mean_token_accuracy": 0.9175932116806507,
+ "num_tokens": 4289773.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.577833125778331,
+ "eval_entropy": 0.38861122120951497,
+ "eval_loss": 0.6115967631340027,
+ "eval_mean_token_accuracy": 0.849471275196519,
+ "eval_num_tokens": 4289773.0,
+ "eval_runtime": 86.2946,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1840
+ },
+ {
+ "entropy": 0.3051785985007882,
+ "epoch": 4.627646326276463,
+ "grad_norm": 0.8109654188156128,
+ "learning_rate": 0.0001471849238862319,
+ "loss": 0.23433220386505127,
+ "mean_token_accuracy": 0.9206570319831371,
+ "num_tokens": 4336894.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.627646326276463,
+ "eval_entropy": 0.37162452295076015,
+ "eval_loss": 0.6184061765670776,
+ "eval_mean_token_accuracy": 0.8501173268223918,
+ "eval_num_tokens": 4336894.0,
+ "eval_runtime": 86.6865,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1860
+ },
+ {
+ "entropy": 0.3168198253959417,
+ "epoch": 4.677459526774595,
+ "grad_norm": 0.9512342214584351,
+ "learning_rate": 0.0001453061146267775,
+ "loss": 0.23832404613494873,
+ "mean_token_accuracy": 0.9197044663131237,
+ "num_tokens": 4382947.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.677459526774595,
+ "eval_entropy": 0.3845940856912801,
+ "eval_loss": 0.606762707233429,
+ "eval_mean_token_accuracy": 0.8504838194957999,
+ "eval_num_tokens": 4382947.0,
+ "eval_runtime": 86.5175,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 1880
+ },
+ {
+ "entropy": 0.30791807882487776,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 0.8123113512992859,
+ "learning_rate": 0.00014341760442398248,
+ "loss": 0.2395785331726074,
+ "mean_token_accuracy": 0.918928150832653,
+ "num_tokens": 4433050.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.7272727272727275,
+ "eval_entropy": 0.39762327222283494,
+ "eval_loss": 0.5994202494621277,
+ "eval_mean_token_accuracy": 0.8509274201337681,
+ "eval_num_tokens": 4433050.0,
+ "eval_runtime": 86.2873,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.993,
+ "step": 1900
+ },
+ {
+ "entropy": 0.3021434534341097,
+ "epoch": 4.777085927770859,
+ "grad_norm": 0.731787383556366,
+ "learning_rate": 0.000141519962826766,
+ "loss": 0.23494718074798585,
+ "mean_token_accuracy": 0.9201403826475143,
+ "num_tokens": 4483598.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.777085927770859,
+ "eval_entropy": 0.3827026732439219,
+ "eval_loss": 0.5995895862579346,
+ "eval_mean_token_accuracy": 0.851468373523202,
+ "eval_num_tokens": 4483598.0,
+ "eval_runtime": 86.3006,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 1920
+ },
+ {
+ "entropy": 0.31626159623265265,
+ "epoch": 4.826899128268991,
+ "grad_norm": 0.8848487138748169,
+ "learning_rate": 0.00013961376213795132,
+ "loss": 0.2439030647277832,
+ "mean_token_accuracy": 0.9196575872600079,
+ "num_tokens": 4529201.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.826899128268991,
+ "eval_entropy": 0.388698436839636,
+ "eval_loss": 0.6000174283981323,
+ "eval_mean_token_accuracy": 0.8518068187458571,
+ "eval_num_tokens": 4529201.0,
+ "eval_runtime": 86.8979,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.979,
+ "step": 1940
+ },
+ {
+ "entropy": 0.30520407035946845,
+ "epoch": 4.876712328767123,
+ "grad_norm": 0.8532460927963257,
+ "learning_rate": 0.00013769957724166695,
+ "loss": 0.23458616733551024,
+ "mean_token_accuracy": 0.9221912942826748,
+ "num_tokens": 4578167.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.876712328767123,
+ "eval_entropy": 0.38777847102908203,
+ "eval_loss": 0.6004981398582458,
+ "eval_mean_token_accuracy": 0.8516481768253238,
+ "eval_num_tokens": 4578167.0,
+ "eval_runtime": 87.0777,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.975,
+ "step": 1960
+ },
+ {
+ "entropy": 0.3226448342204094,
+ "epoch": 4.926525529265255,
+ "grad_norm": 0.6945561766624451,
+ "learning_rate": 0.0001357779854299694,
+ "loss": 0.24048397541046143,
+ "mean_token_accuracy": 0.9195300146937371,
+ "num_tokens": 4622316.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.926525529265255,
+ "eval_entropy": 0.38581624263247777,
+ "eval_loss": 0.6029234528541565,
+ "eval_mean_token_accuracy": 0.8514213260523108,
+ "eval_num_tokens": 4622316.0,
+ "eval_runtime": 85.8729,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 1980
+ },
+ {
+ "entropy": 0.3051655298098922,
+ "epoch": 4.976338729763388,
+ "grad_norm": 0.7976452708244324,
+ "learning_rate": 0.00013384956622874001,
+ "loss": 0.23584742546081544,
+ "mean_token_accuracy": 0.9216851457953453,
+ "num_tokens": 4670746.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.976338729763388,
+ "eval_entropy": 0.37913159246361533,
+ "eval_loss": 0.6057604551315308,
+ "eval_mean_token_accuracy": 0.8525801203971686,
+ "eval_num_tokens": 4670746.0,
+ "eval_runtime": 86.1145,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2000
+ },
+ {
+ "entropy": 0.27438195240803254,
+ "epoch": 5.024906600249066,
+ "grad_norm": 0.6729586124420166,
+ "learning_rate": 0.0001319149012229075,
+ "loss": 0.19775952100753785,
+ "mean_token_accuracy": 0.9339428559327737,
+ "num_tokens": 4716176.0,
+ "step": 2020
+ },
+ {
+ "epoch": 5.024906600249066,
+ "eval_entropy": 0.3448961910813354,
+ "eval_loss": 0.6750120520591736,
+ "eval_mean_token_accuracy": 0.8487970232963562,
+ "eval_num_tokens": 4716176.0,
+ "eval_runtime": 86.1169,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2020
+ },
+ {
+ "entropy": 0.21423916313797237,
+ "epoch": 5.074719800747198,
+ "grad_norm": 0.6934391856193542,
+ "learning_rate": 0.00012997457388105022,
+ "loss": 0.1439570426940918,
+ "mean_token_accuracy": 0.9528236843645572,
+ "num_tokens": 4763269.0,
+ "step": 2040
+ },
+ {
+ "epoch": 5.074719800747198,
+ "eval_entropy": 0.3570949243771475,
+ "eval_loss": 0.6465504169464111,
+ "eval_mean_token_accuracy": 0.8490785547467166,
+ "eval_num_tokens": 4763269.0,
+ "eval_runtime": 85.9574,
+ "eval_samples_per_second": 15.996,
+ "eval_steps_per_second": 2.001,
+ "step": 2040
+ },
+ {
+ "entropy": 0.20838565267622472,
+ "epoch": 5.12453300124533,
+ "grad_norm": 0.7286986112594604,
+ "learning_rate": 0.00012802916937942972,
+ "loss": 0.14467307329177856,
+ "mean_token_accuracy": 0.950994835793972,
+ "num_tokens": 4809047.0,
+ "step": 2060
+ },
+ {
+ "epoch": 5.12453300124533,
+ "eval_entropy": 0.3452463157821533,
+ "eval_loss": 0.6705958843231201,
+ "eval_mean_token_accuracy": 0.8490352796953778,
+ "eval_num_tokens": 4809047.0,
+ "eval_runtime": 86.228,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 2060
+ },
+ {
+ "entropy": 0.20453082229942082,
+ "epoch": 5.174346201743462,
+ "grad_norm": 0.7515555620193481,
+ "learning_rate": 0.00012607927442550974,
+ "loss": 0.13732000589370727,
+ "mean_token_accuracy": 0.9537357829511166,
+ "num_tokens": 4857965.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.174346201743462,
+ "eval_entropy": 0.32431264914745506,
+ "eval_loss": 0.6743043065071106,
+ "eval_mean_token_accuracy": 0.8504878629085629,
+ "eval_num_tokens": 4857965.0,
+ "eval_runtime": 86.5948,
+ "eval_samples_per_second": 15.879,
+ "eval_steps_per_second": 1.986,
+ "step": 2080
+ },
+ {
+ "entropy": 0.21812320686876774,
+ "epoch": 5.224159402241594,
+ "grad_norm": 0.9093465209007263,
+ "learning_rate": 0.0001241254770810132,
+ "loss": 0.14311420917510986,
+ "mean_token_accuracy": 0.9514068141579628,
+ "num_tokens": 4905151.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.224159402241594,
+ "eval_entropy": 0.33086285835435225,
+ "eval_loss": 0.6676449179649353,
+ "eval_mean_token_accuracy": 0.8505287662495015,
+ "eval_num_tokens": 4905151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 2100
+ },
+ {
+ "entropy": 0.2180163251236081,
+ "epoch": 5.273972602739726,
+ "grad_norm": 0.6703007221221924,
+ "learning_rate": 0.00012216836658457075,
+ "loss": 0.14803968667984008,
+ "mean_token_accuracy": 0.9521303348243236,
+ "num_tokens": 4947072.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.273972602739726,
+ "eval_entropy": 0.33162341708707255,
+ "eval_loss": 0.6658875942230225,
+ "eval_mean_token_accuracy": 0.8500757605530495,
+ "eval_num_tokens": 4947072.0,
+ "eval_runtime": 86.6296,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 2120
+ },
+ {
+ "entropy": 0.22511130161583423,
+ "epoch": 5.323785803237858,
+ "grad_norm": 0.8078880906105042,
+ "learning_rate": 0.00012020853317401455,
+ "loss": 0.15228408575057983,
+ "mean_token_accuracy": 0.947144789993763,
+ "num_tokens": 4991974.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.323785803237858,
+ "eval_entropy": 0.3354601170434508,
+ "eval_loss": 0.6677829623222351,
+ "eval_mean_token_accuracy": 0.8482600024273229,
+ "eval_num_tokens": 4991974.0,
+ "eval_runtime": 86.4689,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.989,
+ "step": 2140
+ },
+ {
+ "entropy": 0.2244176059961319,
+ "epoch": 5.37359900373599,
+ "grad_norm": 0.9636075496673584,
+ "learning_rate": 0.00011824656790837037,
+ "loss": 0.15260883569717407,
+ "mean_token_accuracy": 0.9471467643976211,
+ "num_tokens": 5038400.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.37359900373599,
+ "eval_entropy": 0.3381616926297199,
+ "eval_loss": 0.6694412231445312,
+ "eval_mean_token_accuracy": 0.8482369603805764,
+ "eval_num_tokens": 5038400.0,
+ "eval_runtime": 86.4147,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 2160
+ },
+ {
+ "entropy": 0.22982364390045404,
+ "epoch": 5.423412204234122,
+ "grad_norm": 0.775401771068573,
+ "learning_rate": 0.00011628306248960262,
+ "loss": 0.15140302181243898,
+ "mean_token_accuracy": 0.9492553934454918,
+ "num_tokens": 5083166.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.423412204234122,
+ "eval_entropy": 0.3305150235808173,
+ "eval_loss": 0.6717822551727295,
+ "eval_mean_token_accuracy": 0.8489849723355715,
+ "eval_num_tokens": 5083166.0,
+ "eval_runtime": 86.4728,
+ "eval_samples_per_second": 15.901,
+ "eval_steps_per_second": 1.989,
+ "step": 2180
+ },
+ {
+ "entropy": 0.21448935717344284,
+ "epoch": 5.473225404732254,
+ "grad_norm": 0.6575281023979187,
+ "learning_rate": 0.00011431860908416465,
+ "loss": 0.1452319622039795,
+ "mean_token_accuracy": 0.9505287684500218,
+ "num_tokens": 5135109.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.473225404732254,
+ "eval_entropy": 0.3488145174328671,
+ "eval_loss": 0.6612305641174316,
+ "eval_mean_token_accuracy": 0.8492907808963642,
+ "eval_num_tokens": 5135109.0,
+ "eval_runtime": 86.6927,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 2200
+ },
+ {
+ "entropy": 0.23091202937066554,
+ "epoch": 5.523038605230386,
+ "grad_norm": 0.8909686207771301,
+ "learning_rate": 0.00011235380014440985,
+ "loss": 0.15150139331817628,
+ "mean_token_accuracy": 0.9497875183820724,
+ "num_tokens": 5180138.0,
+ "step": 2220
+ },
+ {
+ "epoch": 5.523038605230386,
+ "eval_entropy": 0.3268539015810157,
+ "eval_loss": 0.6667542457580566,
+ "eval_mean_token_accuracy": 0.8499062903398691,
+ "eval_num_tokens": 5180138.0,
+ "eval_runtime": 86.4644,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 2220
+ },
+ {
+ "entropy": 0.2227974807843566,
+ "epoch": 5.572851805728518,
+ "grad_norm": 0.6180275082588196,
+ "learning_rate": 0.0001103892282299158,
+ "loss": 0.1491069197654724,
+ "mean_token_accuracy": 0.9488144010305405,
+ "num_tokens": 5226864.0,
+ "step": 2240
+ },
+ {
+ "epoch": 5.572851805728518,
+ "eval_entropy": 0.3346347655494546,
+ "eval_loss": 0.6665948629379272,
+ "eval_mean_token_accuracy": 0.8499961893918903,
+ "eval_num_tokens": 5226864.0,
+ "eval_runtime": 87.0548,
+ "eval_samples_per_second": 15.795,
+ "eval_steps_per_second": 1.976,
+ "step": 2240
+ },
+ {
+ "entropy": 0.21368421968072654,
+ "epoch": 5.62266500622665,
+ "grad_norm": 0.6004369258880615,
+ "learning_rate": 0.00010842548582877651,
+ "loss": 0.14485255479812623,
+ "mean_token_accuracy": 0.9502056457102299,
+ "num_tokens": 5276602.0,
+ "step": 2260
+ },
+ {
+ "epoch": 5.62266500622665,
+ "eval_entropy": 0.32753298804163933,
+ "eval_loss": 0.6680151224136353,
+ "eval_mean_token_accuracy": 0.8515451086121936,
+ "eval_num_tokens": 5276602.0,
+ "eval_runtime": 86.8524,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.98,
+ "step": 2260
+ },
+ {
+ "entropy": 0.2103635374456644,
+ "epoch": 5.672478206724782,
+ "grad_norm": 0.699174702167511,
+ "learning_rate": 0.00010646316517891613,
+ "loss": 0.14297772645950318,
+ "mean_token_accuracy": 0.9512537539005279,
+ "num_tokens": 5323718.0,
+ "step": 2280
+ },
+ {
+ "epoch": 5.672478206724782,
+ "eval_entropy": 0.32966585959806,
+ "eval_loss": 0.675578773021698,
+ "eval_mean_token_accuracy": 0.8509623023659684,
+ "eval_num_tokens": 5323718.0,
+ "eval_runtime": 86.4518,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2280
+ },
+ {
+ "entropy": 0.22516900151968003,
+ "epoch": 5.722291407222914,
+ "grad_norm": 0.6637354493141174,
+ "learning_rate": 0.00010450285808947797,
+ "loss": 0.15202572345733642,
+ "mean_token_accuracy": 0.9482452072203159,
+ "num_tokens": 5369039.0,
+ "step": 2300
+ },
+ {
+ "epoch": 5.722291407222914,
+ "eval_entropy": 0.3369456917740578,
+ "eval_loss": 0.6697061061859131,
+ "eval_mean_token_accuracy": 0.848603522361711,
+ "eval_num_tokens": 5369039.0,
+ "eval_runtime": 86.6371,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.985,
+ "step": 2300
+ },
+ {
+ "entropy": 0.21841065725311637,
+ "epoch": 5.772104607721046,
+ "grad_norm": 0.7940268516540527,
+ "learning_rate": 0.00010254515576234297,
+ "loss": 0.14710167646408082,
+ "mean_token_accuracy": 0.9493498183786869,
+ "num_tokens": 5417029.0,
+ "step": 2320
+ },
+ {
+ "epoch": 5.772104607721046,
+ "eval_entropy": 0.3237486180177955,
+ "eval_loss": 0.6779657602310181,
+ "eval_mean_token_accuracy": 0.8500715313955794,
+ "eval_num_tokens": 5417029.0,
+ "eval_runtime": 86.1826,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 1.996,
+ "step": 2320
+ },
+ {
+ "entropy": 0.22146204356104135,
+ "epoch": 5.821917808219178,
+ "grad_norm": 0.9234833121299744,
+ "learning_rate": 0.00010059064861383132,
+ "loss": 0.14720046520233154,
+ "mean_token_accuracy": 0.9493872679769992,
+ "num_tokens": 5461671.0,
+ "step": 2340
+ },
+ {
+ "epoch": 5.821917808219178,
+ "eval_entropy": 0.32365207564692167,
+ "eval_loss": 0.6704005002975464,
+ "eval_mean_token_accuracy": 0.8507985760306203,
+ "eval_num_tokens": 5461671.0,
+ "eval_runtime": 86.5494,
+ "eval_samples_per_second": 15.887,
+ "eval_steps_per_second": 1.987,
+ "step": 2340
+ },
+ {
+ "entropy": 0.20934011954814197,
+ "epoch": 5.87173100871731,
+ "grad_norm": 0.5547503232955933,
+ "learning_rate": 9.863992609664084e-05,
+ "loss": 0.1464867353439331,
+ "mean_token_accuracy": 0.9503875687718392,
+ "num_tokens": 5509312.0,
+ "step": 2360
+ },
+ {
+ "epoch": 5.87173100871731,
+ "eval_entropy": 0.3330401429083458,
+ "eval_loss": 0.6659091114997864,
+ "eval_mean_token_accuracy": 0.8504848906467127,
+ "eval_num_tokens": 5509312.0,
+ "eval_runtime": 86.5855,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 2360
+ },
+ {
+ "entropy": 0.21678635366261007,
+ "epoch": 5.921544209215442,
+ "grad_norm": 0.570612907409668,
+ "learning_rate": 9.669357652207635e-05,
+ "loss": 0.14821385145187377,
+ "mean_token_accuracy": 0.9503940217196941,
+ "num_tokens": 5558196.0,
+ "step": 2380
+ },
+ {
+ "epoch": 5.921544209215442,
+ "eval_entropy": 0.3322022325077722,
+ "eval_loss": 0.6722489595413208,
+ "eval_mean_token_accuracy": 0.8489979422369669,
+ "eval_num_tokens": 5558196.0,
+ "eval_runtime": 86.2986,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 2380
+ },
+ {
+ "entropy": 0.20932920072227718,
+ "epoch": 5.971357409713574,
+ "grad_norm": 0.7879557609558105,
+ "learning_rate": 9.475218688262262e-05,
+ "loss": 0.14675841331481934,
+ "mean_token_accuracy": 0.9507176131010056,
+ "num_tokens": 5605400.0,
+ "step": 2400
+ },
+ {
+ "epoch": 5.971357409713574,
+ "eval_entropy": 0.3199348642902319,
+ "eval_loss": 0.6698136329650879,
+ "eval_mean_token_accuracy": 0.8514142130003419,
+ "eval_num_tokens": 5605400.0,
+ "eval_runtime": 85.8995,
+ "eval_samples_per_second": 16.007,
+ "eval_steps_per_second": 2.002,
+ "step": 2400
+ },
+ {
+ "entropy": 0.21032143919131693,
+ "epoch": 6.019925280199253,
+ "grad_norm": 0.5823076367378235,
+ "learning_rate": 9.281634267491569e-05,
+ "loss": 0.13322267532348633,
+ "mean_token_accuracy": 0.9550939072401096,
+ "num_tokens": 5648968.0,
+ "step": 2420
+ },
+ {
+ "epoch": 6.019925280199253,
+ "eval_entropy": 0.30206270117399303,
+ "eval_loss": 0.7093168497085571,
+ "eval_mean_token_accuracy": 0.8500627639681794,
+ "eval_num_tokens": 5648968.0,
+ "eval_runtime": 85.8128,
+ "eval_samples_per_second": 16.023,
+ "eval_steps_per_second": 2.004,
+ "step": 2420
+ },
+ {
+ "entropy": 0.1534628233872354,
+ "epoch": 6.069738480697385,
+ "grad_norm": 0.710133969783783,
+ "learning_rate": 9.088662772316508e-05,
+ "loss": 0.09078952670097351,
+ "mean_token_accuracy": 0.9678447999060154,
+ "num_tokens": 5697633.0,
+ "step": 2440
+ },
+ {
+ "epoch": 6.069738480697385,
+ "eval_entropy": 0.28208133101809857,
+ "eval_loss": 0.7636417150497437,
+ "eval_mean_token_accuracy": 0.8494061477655588,
+ "eval_num_tokens": 5697633.0,
+ "eval_runtime": 85.9724,
+ "eval_samples_per_second": 15.994,
+ "eval_steps_per_second": 2.001,
+ "step": 2440
+ },
+ {
+ "entropy": 0.16151462448760867,
+ "epoch": 6.119551681195516,
+ "grad_norm": 0.5793812274932861,
+ "learning_rate": 8.896362400308028e-05,
+ "loss": 0.09545697569847107,
+ "mean_token_accuracy": 0.9671573750674725,
+ "num_tokens": 5745090.0,
+ "step": 2460
+ },
+ {
+ "epoch": 6.119551681195516,
+ "eval_entropy": 0.2833245605403601,
+ "eval_loss": 0.7402405738830566,
+ "eval_mean_token_accuracy": 0.8503523728875226,
+ "eval_num_tokens": 5745090.0,
+ "eval_runtime": 85.5461,
+ "eval_samples_per_second": 16.073,
+ "eval_steps_per_second": 2.011,
+ "step": 2460
+ },
+ {
+ "entropy": 0.15203177919611335,
+ "epoch": 6.169364881693649,
+ "grad_norm": 0.4251123368740082,
+ "learning_rate": 8.704791146635483e-05,
+ "loss": 0.09420782327651978,
+ "mean_token_accuracy": 0.9677386932075024,
+ "num_tokens": 5790333.0,
+ "step": 2480
+ },
+ {
+ "epoch": 6.169364881693649,
+ "eval_entropy": 0.28572545962971313,
+ "eval_loss": 0.735416829586029,
+ "eval_mean_token_accuracy": 0.8487084663884584,
+ "eval_num_tokens": 5790333.0,
+ "eval_runtime": 85.4801,
+ "eval_samples_per_second": 16.086,
+ "eval_steps_per_second": 2.012,
+ "step": 2480
+ },
+ {
+ "entropy": 0.15587336672469973,
+ "epoch": 6.219178082191781,
+ "grad_norm": 0.4357028007507324,
+ "learning_rate": 8.514006786576085e-05,
+ "loss": 0.09429320096969604,
+ "mean_token_accuracy": 0.9682952925562859,
+ "num_tokens": 5837321.0,
+ "step": 2500
+ },
+ {
+ "epoch": 6.219178082191781,
+ "eval_entropy": 0.2859006894882335,
+ "eval_loss": 0.7347224950790405,
+ "eval_mean_token_accuracy": 0.8501905518215757,
+ "eval_num_tokens": 5837321.0,
+ "eval_runtime": 85.7578,
+ "eval_samples_per_second": 16.034,
+ "eval_steps_per_second": 2.006,
+ "step": 2500
+ },
+ {
+ "entropy": 0.15765639198943973,
+ "epoch": 6.268991282689913,
+ "grad_norm": 0.47331130504608154,
+ "learning_rate": 8.324066858090663e-05,
+ "loss": 0.09571113586425781,
+ "mean_token_accuracy": 0.9683481335639954,
+ "num_tokens": 5884398.0,
+ "step": 2520
+ },
+ {
+ "epoch": 6.268991282689913,
+ "eval_entropy": 0.29231513846059176,
+ "eval_loss": 0.7392512559890747,
+ "eval_mean_token_accuracy": 0.8486633983462356,
+ "eval_num_tokens": 5884398.0,
+ "eval_runtime": 85.7846,
+ "eval_samples_per_second": 16.029,
+ "eval_steps_per_second": 2.005,
+ "step": 2520
+ },
+ {
+ "entropy": 0.16176860257983208,
+ "epoch": 6.318804483188045,
+ "grad_norm": 0.6142018437385559,
+ "learning_rate": 8.135028644470992e-05,
+ "loss": 0.09486144185066223,
+ "mean_token_accuracy": 0.9682316601276397,
+ "num_tokens": 5929876.0,
+ "step": 2540
+ },
+ {
+ "epoch": 6.318804483188045,
+ "eval_entropy": 0.2851274753379267,
+ "eval_loss": 0.7520816922187805,
+ "eval_mean_token_accuracy": 0.8501113649717597,
+ "eval_num_tokens": 5929876.0,
+ "eval_runtime": 85.9425,
+ "eval_samples_per_second": 15.999,
+ "eval_steps_per_second": 2.001,
+ "step": 2540
+ },
+ {
+ "entropy": 0.15404034564271568,
+ "epoch": 6.3686176836861765,
+ "grad_norm": 0.6051287651062012,
+ "learning_rate": 7.946949157063964e-05,
+ "loss": 0.09280472993850708,
+ "mean_token_accuracy": 0.9684635892510414,
+ "num_tokens": 5978490.0,
+ "step": 2560
+ },
+ {
+ "epoch": 6.3686176836861765,
+ "eval_entropy": 0.28802703563557114,
+ "eval_loss": 0.7439162135124207,
+ "eval_mean_token_accuracy": 0.8499851770872293,
+ "eval_num_tokens": 5978490.0,
+ "eval_runtime": 86.0703,
+ "eval_samples_per_second": 15.975,
+ "eval_steps_per_second": 1.998,
+ "step": 2560
+ },
+ {
+ "entropy": 0.15343588953837753,
+ "epoch": 6.418430884184309,
+ "grad_norm": 0.4823743402957916,
+ "learning_rate": 7.759885118077701e-05,
+ "loss": 0.09000591039657593,
+ "mean_token_accuracy": 0.9699928767979145,
+ "num_tokens": 6025380.0,
+ "step": 2580
+ },
+ {
+ "epoch": 6.418430884184309,
+ "eval_entropy": 0.2795634938533916,
+ "eval_loss": 0.7647850513458252,
+ "eval_mean_token_accuracy": 0.8503464397995971,
+ "eval_num_tokens": 6025380.0,
+ "eval_runtime": 85.8886,
+ "eval_samples_per_second": 16.009,
+ "eval_steps_per_second": 2.003,
+ "step": 2580
+ },
+ {
+ "entropy": 0.15740026142448188,
+ "epoch": 6.468244084682441,
+ "grad_norm": 0.5082696676254272,
+ "learning_rate": 7.57389294347494e-05,
+ "loss": 0.09191849827766418,
+ "mean_token_accuracy": 0.9692809768021107,
+ "num_tokens": 6073349.0,
+ "step": 2600
+ },
+ {
+ "epoch": 6.468244084682441,
+ "eval_entropy": 0.2913342311458532,
+ "eval_loss": 0.7518694996833801,
+ "eval_mean_token_accuracy": 0.8483168302580367,
+ "eval_num_tokens": 6073349.0,
+ "eval_runtime": 85.5761,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.01,
+ "step": 2600
+ },
+ {
+ "entropy": 0.15922069251537324,
+ "epoch": 6.518057285180573,
+ "grad_norm": 0.3995199501514435,
+ "learning_rate": 7.389028725958736e-05,
+ "loss": 0.09584367871284485,
+ "mean_token_accuracy": 0.9685114495456218,
+ "num_tokens": 6118148.0,
+ "step": 2620
+ },
+ {
+ "epoch": 6.518057285180573,
+ "eval_entropy": 0.2863075934177221,
+ "eval_loss": 0.7539381384849548,
+ "eval_mean_token_accuracy": 0.8507507083027862,
+ "eval_num_tokens": 6118148.0,
+ "eval_runtime": 86.112,
+ "eval_samples_per_second": 15.968,
+ "eval_steps_per_second": 1.997,
+ "step": 2620
+ },
+ {
+ "entropy": 0.16197575423866512,
+ "epoch": 6.567870485678705,
+ "grad_norm": 0.534295380115509,
+ "learning_rate": 7.205348218055678e-05,
+ "loss": 0.0961170256137848,
+ "mean_token_accuracy": 0.9674530044198036,
+ "num_tokens": 6165523.0,
+ "step": 2640
+ },
+ {
+ "epoch": 6.567870485678705,
+ "eval_entropy": 0.29021967315050057,
+ "eval_loss": 0.751198947429657,
+ "eval_mean_token_accuracy": 0.8509796344956686,
+ "eval_num_tokens": 6165523.0,
+ "eval_runtime": 85.7958,
+ "eval_samples_per_second": 16.026,
+ "eval_steps_per_second": 2.005,
+ "step": 2640
+ },
+ {
+ "entropy": 0.15261746793985367,
+ "epoch": 6.617683686176837,
+ "grad_norm": 0.5391237139701843,
+ "learning_rate": 7.022906815301673e-05,
+ "loss": 0.0926026999950409,
+ "mean_token_accuracy": 0.9695659473538398,
+ "num_tokens": 6216232.0,
+ "step": 2660
+ },
+ {
+ "epoch": 6.617683686176837,
+ "eval_entropy": 0.29128045216202736,
+ "eval_loss": 0.7450292110443115,
+ "eval_mean_token_accuracy": 0.8498771443616512,
+ "eval_num_tokens": 6216232.0,
+ "eval_runtime": 86.3963,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 2660
+ },
+ {
+ "entropy": 0.16164180357009172,
+ "epoch": 6.667496886674969,
+ "grad_norm": 0.5767946243286133,
+ "learning_rate": 6.841759539535419e-05,
+ "loss": 0.09291981458663941,
+ "mean_token_accuracy": 0.9687136687338352,
+ "num_tokens": 6264807.0,
+ "step": 2680
+ },
+ {
+ "epoch": 6.667496886674969,
+ "eval_entropy": 0.2897637223088464,
+ "eval_loss": 0.7503410577774048,
+ "eval_mean_token_accuracy": 0.8503315164599308,
+ "eval_num_tokens": 6264807.0,
+ "eval_runtime": 86.0653,
+ "eval_samples_per_second": 15.976,
+ "eval_steps_per_second": 1.998,
+ "step": 2680
+ },
+ {
+ "entropy": 0.17062523355707526,
+ "epoch": 6.717310087173101,
+ "grad_norm": 0.4974168539047241,
+ "learning_rate": 6.661961022304563e-05,
+ "loss": 0.09713236689567566,
+ "mean_token_accuracy": 0.9661971725523472,
+ "num_tokens": 6308819.0,
+ "step": 2700
+ },
+ {
+ "epoch": 6.717310087173101,
+ "eval_entropy": 0.2765843396963075,
+ "eval_loss": 0.7604002356529236,
+ "eval_mean_token_accuracy": 0.8521115277395692,
+ "eval_num_tokens": 6308819.0,
+ "eval_runtime": 86.1676,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 2700
+ },
+ {
+ "entropy": 0.17544092936441302,
+ "epoch": 6.767123287671232,
+ "grad_norm": 0.5523537993431091,
+ "learning_rate": 6.483565488389582e-05,
+ "loss": 0.09709116220474243,
+ "mean_token_accuracy": 0.9650957375764847,
+ "num_tokens": 6352548.0,
+ "step": 2720
+ },
+ {
+ "epoch": 6.767123287671232,
+ "eval_entropy": 0.27939334659035814,
+ "eval_loss": 0.7534670829772949,
+ "eval_mean_token_accuracy": 0.851230604010959,
+ "eval_num_tokens": 6352548.0,
+ "eval_runtime": 86.2913,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 2720
+ },
+ {
+ "entropy": 0.15991022661328316,
+ "epoch": 6.816936488169365,
+ "grad_norm": 0.478551983833313,
+ "learning_rate": 6.306626739450311e-05,
+ "loss": 0.09564646482467651,
+ "mean_token_accuracy": 0.9679084822535515,
+ "num_tokens": 6397720.0,
+ "step": 2740
+ },
+ {
+ "epoch": 6.816936488169365,
+ "eval_entropy": 0.27878295491601146,
+ "eval_loss": 0.7519959211349487,
+ "eval_mean_token_accuracy": 0.8510654949864676,
+ "eval_num_tokens": 6397720.0,
+ "eval_runtime": 85.9109,
+ "eval_samples_per_second": 16.005,
+ "eval_steps_per_second": 2.002,
+ "step": 2740
+ },
+ {
+ "entropy": 0.16824879590421915,
+ "epoch": 6.866749688667497,
+ "grad_norm": 0.6681098937988281,
+ "learning_rate": 6.131198137800108e-05,
+ "loss": 0.0962279736995697,
+ "mean_token_accuracy": 0.966830012947321,
+ "num_tokens": 6442821.0,
+ "step": 2760
+ },
+ {
+ "epoch": 6.866749688667497,
+ "eval_entropy": 0.2834690434121808,
+ "eval_loss": 0.751922070980072,
+ "eval_mean_token_accuracy": 0.8521237577809844,
+ "eval_num_tokens": 6442821.0,
+ "eval_runtime": 86.3618,
+ "eval_samples_per_second": 15.921,
+ "eval_steps_per_second": 1.992,
+ "step": 2760
+ },
+ {
+ "entropy": 0.1518704930320382,
+ "epoch": 6.916562889165629,
+ "grad_norm": 0.5201290249824524,
+ "learning_rate": 5.957332590312513e-05,
+ "loss": 0.09010660648345947,
+ "mean_token_accuracy": 0.9693463340401649,
+ "num_tokens": 6494118.0,
+ "step": 2780
+ },
+ {
+ "epoch": 6.916562889165629,
+ "eval_entropy": 0.28485129617674404,
+ "eval_loss": 0.7452457547187805,
+ "eval_mean_token_accuracy": 0.8512036796919135,
+ "eval_num_tokens": 6494118.0,
+ "eval_runtime": 86.4524,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2780
+ },
+ {
+ "entropy": 0.15512610590085388,
+ "epoch": 6.966376089663761,
+ "grad_norm": 0.42802050709724426,
+ "learning_rate": 5.785082532465233e-05,
+ "loss": 0.09320432543754578,
+ "mean_token_accuracy": 0.9686134628951549,
+ "num_tokens": 6540175.0,
+ "step": 2800
+ },
+ {
+ "epoch": 6.966376089663761,
+ "eval_entropy": 0.27554594526110693,
+ "eval_loss": 0.7644653916358948,
+ "eval_mean_token_accuracy": 0.8513738523389018,
+ "eval_num_tokens": 6540175.0,
+ "eval_runtime": 85.7609,
+ "eval_samples_per_second": 16.033,
+ "eval_steps_per_second": 2.006,
+ "step": 2800
+ },
+ {
+ "entropy": 0.17524497526196334,
+ "epoch": 7.01494396014944,
+ "grad_norm": 0.3330269157886505,
+ "learning_rate": 5.6144999125263545e-05,
+ "loss": 0.0895616888999939,
+ "mean_token_accuracy": 0.9682766932707566,
+ "num_tokens": 6583767.0,
+ "step": 2820
+ },
+ {
+ "epoch": 7.01494396014944,
+ "eval_entropy": 0.2735865569218647,
+ "eval_loss": 0.768479585647583,
+ "eval_mean_token_accuracy": 0.8503459383581959,
+ "eval_num_tokens": 6583767.0,
+ "eval_runtime": 85.7162,
+ "eval_samples_per_second": 16.041,
+ "eval_steps_per_second": 2.007,
+ "step": 2820
+ },
+ {
+ "entropy": 0.1403565663844347,
+ "epoch": 7.064757160647572,
+ "grad_norm": 0.35613498091697693,
+ "learning_rate": 5.4456361758874235e-05,
+ "loss": 0.07551313638687134,
+ "mean_token_accuracy": 0.9739301167428493,
+ "num_tokens": 6627672.0,
+ "step": 2840
+ },
+ {
+ "epoch": 7.064757160647572,
+ "eval_entropy": 0.25941789089593775,
+ "eval_loss": 0.8209511637687683,
+ "eval_mean_token_accuracy": 0.8505055855873019,
+ "eval_num_tokens": 6627672.0,
+ "eval_runtime": 86.0943,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 2840
+ },
+ {
+ "entropy": 0.13500106502324344,
+ "epoch": 7.114570361145703,
+ "grad_norm": 0.34418627619743347,
+ "learning_rate": 5.2785422495482234e-05,
+ "loss": 0.07293946146965027,
+ "mean_token_accuracy": 0.9747208289802074,
+ "num_tokens": 6672946.0,
+ "step": 2860
+ },
+ {
+ "epoch": 7.114570361145703,
+ "eval_entropy": 0.26482899772912954,
+ "eval_loss": 0.798904538154602,
+ "eval_mean_token_accuracy": 0.8511530233677044,
+ "eval_num_tokens": 6672946.0,
+ "eval_runtime": 85.7915,
+ "eval_samples_per_second": 16.027,
+ "eval_steps_per_second": 2.005,
+ "step": 2860
+ },
+ {
+ "entropy": 0.13127502552233636,
+ "epoch": 7.164383561643835,
+ "grad_norm": 0.4638441503047943,
+ "learning_rate": 5.113268526757892e-05,
+ "loss": 0.07121461629867554,
+ "mean_token_accuracy": 0.9756786689162255,
+ "num_tokens": 6718582.0,
+ "step": 2880
+ },
+ {
+ "epoch": 7.164383561643835,
+ "eval_entropy": 0.2645381211714689,
+ "eval_loss": 0.809101939201355,
+ "eval_mean_token_accuracy": 0.8514727898115335,
+ "eval_num_tokens": 6718582.0,
+ "eval_runtime": 85.84,
+ "eval_samples_per_second": 16.018,
+ "eval_steps_per_second": 2.004,
+ "step": 2880
+ },
+ {
+ "entropy": 0.1331390908919275,
+ "epoch": 7.214196762141968,
+ "grad_norm": 0.40206775069236755,
+ "learning_rate": 4.949864851817007e-05,
+ "loss": 0.07188264131546021,
+ "mean_token_accuracy": 0.9755406074225903,
+ "num_tokens": 6764387.0,
+ "step": 2900
+ },
+ {
+ "epoch": 7.214196762141968,
+ "eval_entropy": 0.26244733283339544,
+ "eval_loss": 0.8143188953399658,
+ "eval_mean_token_accuracy": 0.8514358189909957,
+ "eval_num_tokens": 6764387.0,
+ "eval_runtime": 85.8546,
+ "eval_samples_per_second": 16.015,
+ "eval_steps_per_second": 2.003,
+ "step": 2900
+ },
+ {
+ "entropy": 0.13647331558167936,
+ "epoch": 7.2640099626401,
+ "grad_norm": 0.26405787467956543,
+ "learning_rate": 4.788380505045224e-05,
+ "loss": 0.07412450313568116,
+ "mean_token_accuracy": 0.9744274213910102,
+ "num_tokens": 6809678.0,
+ "step": 2920
+ },
+ {
+ "epoch": 7.2640099626401,
+ "eval_entropy": 0.2626111418182074,
+ "eval_loss": 0.8111525177955627,
+ "eval_mean_token_accuracy": 0.8512121695418691,
+ "eval_num_tokens": 6809678.0,
+ "eval_runtime": 85.9626,
+ "eval_samples_per_second": 15.995,
+ "eval_steps_per_second": 2.001,
+ "step": 2920
+ },
+ {
+ "entropy": 0.12644002586603165,
+ "epoch": 7.313823163138232,
+ "grad_norm": 0.27514681220054626,
+ "learning_rate": 4.6288641879189884e-05,
+ "loss": 0.06807711124420165,
+ "mean_token_accuracy": 0.9760703906416893,
+ "num_tokens": 6860750.0,
+ "step": 2940
+ },
+ {
+ "epoch": 7.313823163138232,
+ "eval_entropy": 0.26096762734097106,
+ "eval_loss": 0.8184595108032227,
+ "eval_mean_token_accuracy": 0.8501476153384807,
+ "eval_num_tokens": 6860750.0,
+ "eval_runtime": 85.9521,
+ "eval_samples_per_second": 15.997,
+ "eval_steps_per_second": 2.001,
+ "step": 2940
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.893204472802079e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2960/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2960/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2960/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2960/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2960/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2960/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2960/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2960/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2960/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2960/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2960/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2960/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2960/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2960/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..d829ed75723b90c4aa1ef98a41f87ede4761d8f1
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2960/trainer_state.json
@@ -0,0 +1,3142 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 7.363636363636363,
+ "eval_steps": 20,
+ "global_step": 2960,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ },
+ {
+ "entropy": 0.3193941755220294,
+ "epoch": 4.5280199252802,
+ "grad_norm": 0.8281906843185425,
+ "learning_rate": 0.0001509111761786888,
+ "loss": 0.23936262130737304,
+ "mean_token_accuracy": 0.9201708927750587,
+ "num_tokens": 4244423.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.5280199252802,
+ "eval_entropy": 0.38704028864239537,
+ "eval_loss": 0.6006569266319275,
+ "eval_mean_token_accuracy": 0.8502406720505205,
+ "eval_num_tokens": 4244423.0,
+ "eval_runtime": 86.8059,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1820
+ },
+ {
+ "entropy": 0.3164879363030195,
+ "epoch": 4.577833125778331,
+ "grad_norm": 0.7892968654632568,
+ "learning_rate": 0.00014905346557909867,
+ "loss": 0.24541733264923096,
+ "mean_token_accuracy": 0.9175932116806507,
+ "num_tokens": 4289773.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.577833125778331,
+ "eval_entropy": 0.38861122120951497,
+ "eval_loss": 0.6115967631340027,
+ "eval_mean_token_accuracy": 0.849471275196519,
+ "eval_num_tokens": 4289773.0,
+ "eval_runtime": 86.2946,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1840
+ },
+ {
+ "entropy": 0.3051785985007882,
+ "epoch": 4.627646326276463,
+ "grad_norm": 0.8109654188156128,
+ "learning_rate": 0.0001471849238862319,
+ "loss": 0.23433220386505127,
+ "mean_token_accuracy": 0.9206570319831371,
+ "num_tokens": 4336894.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.627646326276463,
+ "eval_entropy": 0.37162452295076015,
+ "eval_loss": 0.6184061765670776,
+ "eval_mean_token_accuracy": 0.8501173268223918,
+ "eval_num_tokens": 4336894.0,
+ "eval_runtime": 86.6865,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1860
+ },
+ {
+ "entropy": 0.3168198253959417,
+ "epoch": 4.677459526774595,
+ "grad_norm": 0.9512342214584351,
+ "learning_rate": 0.0001453061146267775,
+ "loss": 0.23832404613494873,
+ "mean_token_accuracy": 0.9197044663131237,
+ "num_tokens": 4382947.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.677459526774595,
+ "eval_entropy": 0.3845940856912801,
+ "eval_loss": 0.606762707233429,
+ "eval_mean_token_accuracy": 0.8504838194957999,
+ "eval_num_tokens": 4382947.0,
+ "eval_runtime": 86.5175,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 1880
+ },
+ {
+ "entropy": 0.30791807882487776,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 0.8123113512992859,
+ "learning_rate": 0.00014341760442398248,
+ "loss": 0.2395785331726074,
+ "mean_token_accuracy": 0.918928150832653,
+ "num_tokens": 4433050.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.7272727272727275,
+ "eval_entropy": 0.39762327222283494,
+ "eval_loss": 0.5994202494621277,
+ "eval_mean_token_accuracy": 0.8509274201337681,
+ "eval_num_tokens": 4433050.0,
+ "eval_runtime": 86.2873,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.993,
+ "step": 1900
+ },
+ {
+ "entropy": 0.3021434534341097,
+ "epoch": 4.777085927770859,
+ "grad_norm": 0.731787383556366,
+ "learning_rate": 0.000141519962826766,
+ "loss": 0.23494718074798585,
+ "mean_token_accuracy": 0.9201403826475143,
+ "num_tokens": 4483598.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.777085927770859,
+ "eval_entropy": 0.3827026732439219,
+ "eval_loss": 0.5995895862579346,
+ "eval_mean_token_accuracy": 0.851468373523202,
+ "eval_num_tokens": 4483598.0,
+ "eval_runtime": 86.3006,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 1920
+ },
+ {
+ "entropy": 0.31626159623265265,
+ "epoch": 4.826899128268991,
+ "grad_norm": 0.8848487138748169,
+ "learning_rate": 0.00013961376213795132,
+ "loss": 0.2439030647277832,
+ "mean_token_accuracy": 0.9196575872600079,
+ "num_tokens": 4529201.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.826899128268991,
+ "eval_entropy": 0.388698436839636,
+ "eval_loss": 0.6000174283981323,
+ "eval_mean_token_accuracy": 0.8518068187458571,
+ "eval_num_tokens": 4529201.0,
+ "eval_runtime": 86.8979,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.979,
+ "step": 1940
+ },
+ {
+ "entropy": 0.30520407035946845,
+ "epoch": 4.876712328767123,
+ "grad_norm": 0.8532460927963257,
+ "learning_rate": 0.00013769957724166695,
+ "loss": 0.23458616733551024,
+ "mean_token_accuracy": 0.9221912942826748,
+ "num_tokens": 4578167.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.876712328767123,
+ "eval_entropy": 0.38777847102908203,
+ "eval_loss": 0.6004981398582458,
+ "eval_mean_token_accuracy": 0.8516481768253238,
+ "eval_num_tokens": 4578167.0,
+ "eval_runtime": 87.0777,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.975,
+ "step": 1960
+ },
+ {
+ "entropy": 0.3226448342204094,
+ "epoch": 4.926525529265255,
+ "grad_norm": 0.6945561766624451,
+ "learning_rate": 0.0001357779854299694,
+ "loss": 0.24048397541046143,
+ "mean_token_accuracy": 0.9195300146937371,
+ "num_tokens": 4622316.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.926525529265255,
+ "eval_entropy": 0.38581624263247777,
+ "eval_loss": 0.6029234528541565,
+ "eval_mean_token_accuracy": 0.8514213260523108,
+ "eval_num_tokens": 4622316.0,
+ "eval_runtime": 85.8729,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 1980
+ },
+ {
+ "entropy": 0.3051655298098922,
+ "epoch": 4.976338729763388,
+ "grad_norm": 0.7976452708244324,
+ "learning_rate": 0.00013384956622874001,
+ "loss": 0.23584742546081544,
+ "mean_token_accuracy": 0.9216851457953453,
+ "num_tokens": 4670746.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.976338729763388,
+ "eval_entropy": 0.37913159246361533,
+ "eval_loss": 0.6057604551315308,
+ "eval_mean_token_accuracy": 0.8525801203971686,
+ "eval_num_tokens": 4670746.0,
+ "eval_runtime": 86.1145,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2000
+ },
+ {
+ "entropy": 0.27438195240803254,
+ "epoch": 5.024906600249066,
+ "grad_norm": 0.6729586124420166,
+ "learning_rate": 0.0001319149012229075,
+ "loss": 0.19775952100753785,
+ "mean_token_accuracy": 0.9339428559327737,
+ "num_tokens": 4716176.0,
+ "step": 2020
+ },
+ {
+ "epoch": 5.024906600249066,
+ "eval_entropy": 0.3448961910813354,
+ "eval_loss": 0.6750120520591736,
+ "eval_mean_token_accuracy": 0.8487970232963562,
+ "eval_num_tokens": 4716176.0,
+ "eval_runtime": 86.1169,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2020
+ },
+ {
+ "entropy": 0.21423916313797237,
+ "epoch": 5.074719800747198,
+ "grad_norm": 0.6934391856193542,
+ "learning_rate": 0.00012997457388105022,
+ "loss": 0.1439570426940918,
+ "mean_token_accuracy": 0.9528236843645572,
+ "num_tokens": 4763269.0,
+ "step": 2040
+ },
+ {
+ "epoch": 5.074719800747198,
+ "eval_entropy": 0.3570949243771475,
+ "eval_loss": 0.6465504169464111,
+ "eval_mean_token_accuracy": 0.8490785547467166,
+ "eval_num_tokens": 4763269.0,
+ "eval_runtime": 85.9574,
+ "eval_samples_per_second": 15.996,
+ "eval_steps_per_second": 2.001,
+ "step": 2040
+ },
+ {
+ "entropy": 0.20838565267622472,
+ "epoch": 5.12453300124533,
+ "grad_norm": 0.7286986112594604,
+ "learning_rate": 0.00012802916937942972,
+ "loss": 0.14467307329177856,
+ "mean_token_accuracy": 0.950994835793972,
+ "num_tokens": 4809047.0,
+ "step": 2060
+ },
+ {
+ "epoch": 5.12453300124533,
+ "eval_entropy": 0.3452463157821533,
+ "eval_loss": 0.6705958843231201,
+ "eval_mean_token_accuracy": 0.8490352796953778,
+ "eval_num_tokens": 4809047.0,
+ "eval_runtime": 86.228,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 2060
+ },
+ {
+ "entropy": 0.20453082229942082,
+ "epoch": 5.174346201743462,
+ "grad_norm": 0.7515555620193481,
+ "learning_rate": 0.00012607927442550974,
+ "loss": 0.13732000589370727,
+ "mean_token_accuracy": 0.9537357829511166,
+ "num_tokens": 4857965.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.174346201743462,
+ "eval_entropy": 0.32431264914745506,
+ "eval_loss": 0.6743043065071106,
+ "eval_mean_token_accuracy": 0.8504878629085629,
+ "eval_num_tokens": 4857965.0,
+ "eval_runtime": 86.5948,
+ "eval_samples_per_second": 15.879,
+ "eval_steps_per_second": 1.986,
+ "step": 2080
+ },
+ {
+ "entropy": 0.21812320686876774,
+ "epoch": 5.224159402241594,
+ "grad_norm": 0.9093465209007263,
+ "learning_rate": 0.0001241254770810132,
+ "loss": 0.14311420917510986,
+ "mean_token_accuracy": 0.9514068141579628,
+ "num_tokens": 4905151.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.224159402241594,
+ "eval_entropy": 0.33086285835435225,
+ "eval_loss": 0.6676449179649353,
+ "eval_mean_token_accuracy": 0.8505287662495015,
+ "eval_num_tokens": 4905151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 2100
+ },
+ {
+ "entropy": 0.2180163251236081,
+ "epoch": 5.273972602739726,
+ "grad_norm": 0.6703007221221924,
+ "learning_rate": 0.00012216836658457075,
+ "loss": 0.14803968667984008,
+ "mean_token_accuracy": 0.9521303348243236,
+ "num_tokens": 4947072.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.273972602739726,
+ "eval_entropy": 0.33162341708707255,
+ "eval_loss": 0.6658875942230225,
+ "eval_mean_token_accuracy": 0.8500757605530495,
+ "eval_num_tokens": 4947072.0,
+ "eval_runtime": 86.6296,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 2120
+ },
+ {
+ "entropy": 0.22511130161583423,
+ "epoch": 5.323785803237858,
+ "grad_norm": 0.8078880906105042,
+ "learning_rate": 0.00012020853317401455,
+ "loss": 0.15228408575057983,
+ "mean_token_accuracy": 0.947144789993763,
+ "num_tokens": 4991974.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.323785803237858,
+ "eval_entropy": 0.3354601170434508,
+ "eval_loss": 0.6677829623222351,
+ "eval_mean_token_accuracy": 0.8482600024273229,
+ "eval_num_tokens": 4991974.0,
+ "eval_runtime": 86.4689,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.989,
+ "step": 2140
+ },
+ {
+ "entropy": 0.2244176059961319,
+ "epoch": 5.37359900373599,
+ "grad_norm": 0.9636075496673584,
+ "learning_rate": 0.00011824656790837037,
+ "loss": 0.15260883569717407,
+ "mean_token_accuracy": 0.9471467643976211,
+ "num_tokens": 5038400.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.37359900373599,
+ "eval_entropy": 0.3381616926297199,
+ "eval_loss": 0.6694412231445312,
+ "eval_mean_token_accuracy": 0.8482369603805764,
+ "eval_num_tokens": 5038400.0,
+ "eval_runtime": 86.4147,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 2160
+ },
+ {
+ "entropy": 0.22982364390045404,
+ "epoch": 5.423412204234122,
+ "grad_norm": 0.775401771068573,
+ "learning_rate": 0.00011628306248960262,
+ "loss": 0.15140302181243898,
+ "mean_token_accuracy": 0.9492553934454918,
+ "num_tokens": 5083166.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.423412204234122,
+ "eval_entropy": 0.3305150235808173,
+ "eval_loss": 0.6717822551727295,
+ "eval_mean_token_accuracy": 0.8489849723355715,
+ "eval_num_tokens": 5083166.0,
+ "eval_runtime": 86.4728,
+ "eval_samples_per_second": 15.901,
+ "eval_steps_per_second": 1.989,
+ "step": 2180
+ },
+ {
+ "entropy": 0.21448935717344284,
+ "epoch": 5.473225404732254,
+ "grad_norm": 0.6575281023979187,
+ "learning_rate": 0.00011431860908416465,
+ "loss": 0.1452319622039795,
+ "mean_token_accuracy": 0.9505287684500218,
+ "num_tokens": 5135109.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.473225404732254,
+ "eval_entropy": 0.3488145174328671,
+ "eval_loss": 0.6612305641174316,
+ "eval_mean_token_accuracy": 0.8492907808963642,
+ "eval_num_tokens": 5135109.0,
+ "eval_runtime": 86.6927,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 2200
+ },
+ {
+ "entropy": 0.23091202937066554,
+ "epoch": 5.523038605230386,
+ "grad_norm": 0.8909686207771301,
+ "learning_rate": 0.00011235380014440985,
+ "loss": 0.15150139331817628,
+ "mean_token_accuracy": 0.9497875183820724,
+ "num_tokens": 5180138.0,
+ "step": 2220
+ },
+ {
+ "epoch": 5.523038605230386,
+ "eval_entropy": 0.3268539015810157,
+ "eval_loss": 0.6667542457580566,
+ "eval_mean_token_accuracy": 0.8499062903398691,
+ "eval_num_tokens": 5180138.0,
+ "eval_runtime": 86.4644,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 2220
+ },
+ {
+ "entropy": 0.2227974807843566,
+ "epoch": 5.572851805728518,
+ "grad_norm": 0.6180275082588196,
+ "learning_rate": 0.0001103892282299158,
+ "loss": 0.1491069197654724,
+ "mean_token_accuracy": 0.9488144010305405,
+ "num_tokens": 5226864.0,
+ "step": 2240
+ },
+ {
+ "epoch": 5.572851805728518,
+ "eval_entropy": 0.3346347655494546,
+ "eval_loss": 0.6665948629379272,
+ "eval_mean_token_accuracy": 0.8499961893918903,
+ "eval_num_tokens": 5226864.0,
+ "eval_runtime": 87.0548,
+ "eval_samples_per_second": 15.795,
+ "eval_steps_per_second": 1.976,
+ "step": 2240
+ },
+ {
+ "entropy": 0.21368421968072654,
+ "epoch": 5.62266500622665,
+ "grad_norm": 0.6004369258880615,
+ "learning_rate": 0.00010842548582877651,
+ "loss": 0.14485255479812623,
+ "mean_token_accuracy": 0.9502056457102299,
+ "num_tokens": 5276602.0,
+ "step": 2260
+ },
+ {
+ "epoch": 5.62266500622665,
+ "eval_entropy": 0.32753298804163933,
+ "eval_loss": 0.6680151224136353,
+ "eval_mean_token_accuracy": 0.8515451086121936,
+ "eval_num_tokens": 5276602.0,
+ "eval_runtime": 86.8524,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.98,
+ "step": 2260
+ },
+ {
+ "entropy": 0.2103635374456644,
+ "epoch": 5.672478206724782,
+ "grad_norm": 0.699174702167511,
+ "learning_rate": 0.00010646316517891613,
+ "loss": 0.14297772645950318,
+ "mean_token_accuracy": 0.9512537539005279,
+ "num_tokens": 5323718.0,
+ "step": 2280
+ },
+ {
+ "epoch": 5.672478206724782,
+ "eval_entropy": 0.32966585959806,
+ "eval_loss": 0.675578773021698,
+ "eval_mean_token_accuracy": 0.8509623023659684,
+ "eval_num_tokens": 5323718.0,
+ "eval_runtime": 86.4518,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2280
+ },
+ {
+ "entropy": 0.22516900151968003,
+ "epoch": 5.722291407222914,
+ "grad_norm": 0.6637354493141174,
+ "learning_rate": 0.00010450285808947797,
+ "loss": 0.15202572345733642,
+ "mean_token_accuracy": 0.9482452072203159,
+ "num_tokens": 5369039.0,
+ "step": 2300
+ },
+ {
+ "epoch": 5.722291407222914,
+ "eval_entropy": 0.3369456917740578,
+ "eval_loss": 0.6697061061859131,
+ "eval_mean_token_accuracy": 0.848603522361711,
+ "eval_num_tokens": 5369039.0,
+ "eval_runtime": 86.6371,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.985,
+ "step": 2300
+ },
+ {
+ "entropy": 0.21841065725311637,
+ "epoch": 5.772104607721046,
+ "grad_norm": 0.7940268516540527,
+ "learning_rate": 0.00010254515576234297,
+ "loss": 0.14710167646408082,
+ "mean_token_accuracy": 0.9493498183786869,
+ "num_tokens": 5417029.0,
+ "step": 2320
+ },
+ {
+ "epoch": 5.772104607721046,
+ "eval_entropy": 0.3237486180177955,
+ "eval_loss": 0.6779657602310181,
+ "eval_mean_token_accuracy": 0.8500715313955794,
+ "eval_num_tokens": 5417029.0,
+ "eval_runtime": 86.1826,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 1.996,
+ "step": 2320
+ },
+ {
+ "entropy": 0.22146204356104135,
+ "epoch": 5.821917808219178,
+ "grad_norm": 0.9234833121299744,
+ "learning_rate": 0.00010059064861383132,
+ "loss": 0.14720046520233154,
+ "mean_token_accuracy": 0.9493872679769992,
+ "num_tokens": 5461671.0,
+ "step": 2340
+ },
+ {
+ "epoch": 5.821917808219178,
+ "eval_entropy": 0.32365207564692167,
+ "eval_loss": 0.6704005002975464,
+ "eval_mean_token_accuracy": 0.8507985760306203,
+ "eval_num_tokens": 5461671.0,
+ "eval_runtime": 86.5494,
+ "eval_samples_per_second": 15.887,
+ "eval_steps_per_second": 1.987,
+ "step": 2340
+ },
+ {
+ "entropy": 0.20934011954814197,
+ "epoch": 5.87173100871731,
+ "grad_norm": 0.5547503232955933,
+ "learning_rate": 9.863992609664084e-05,
+ "loss": 0.1464867353439331,
+ "mean_token_accuracy": 0.9503875687718392,
+ "num_tokens": 5509312.0,
+ "step": 2360
+ },
+ {
+ "epoch": 5.87173100871731,
+ "eval_entropy": 0.3330401429083458,
+ "eval_loss": 0.6659091114997864,
+ "eval_mean_token_accuracy": 0.8504848906467127,
+ "eval_num_tokens": 5509312.0,
+ "eval_runtime": 86.5855,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 2360
+ },
+ {
+ "entropy": 0.21678635366261007,
+ "epoch": 5.921544209215442,
+ "grad_norm": 0.570612907409668,
+ "learning_rate": 9.669357652207635e-05,
+ "loss": 0.14821385145187377,
+ "mean_token_accuracy": 0.9503940217196941,
+ "num_tokens": 5558196.0,
+ "step": 2380
+ },
+ {
+ "epoch": 5.921544209215442,
+ "eval_entropy": 0.3322022325077722,
+ "eval_loss": 0.6722489595413208,
+ "eval_mean_token_accuracy": 0.8489979422369669,
+ "eval_num_tokens": 5558196.0,
+ "eval_runtime": 86.2986,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 2380
+ },
+ {
+ "entropy": 0.20932920072227718,
+ "epoch": 5.971357409713574,
+ "grad_norm": 0.7879557609558105,
+ "learning_rate": 9.475218688262262e-05,
+ "loss": 0.14675841331481934,
+ "mean_token_accuracy": 0.9507176131010056,
+ "num_tokens": 5605400.0,
+ "step": 2400
+ },
+ {
+ "epoch": 5.971357409713574,
+ "eval_entropy": 0.3199348642902319,
+ "eval_loss": 0.6698136329650879,
+ "eval_mean_token_accuracy": 0.8514142130003419,
+ "eval_num_tokens": 5605400.0,
+ "eval_runtime": 85.8995,
+ "eval_samples_per_second": 16.007,
+ "eval_steps_per_second": 2.002,
+ "step": 2400
+ },
+ {
+ "entropy": 0.21032143919131693,
+ "epoch": 6.019925280199253,
+ "grad_norm": 0.5823076367378235,
+ "learning_rate": 9.281634267491569e-05,
+ "loss": 0.13322267532348633,
+ "mean_token_accuracy": 0.9550939072401096,
+ "num_tokens": 5648968.0,
+ "step": 2420
+ },
+ {
+ "epoch": 6.019925280199253,
+ "eval_entropy": 0.30206270117399303,
+ "eval_loss": 0.7093168497085571,
+ "eval_mean_token_accuracy": 0.8500627639681794,
+ "eval_num_tokens": 5648968.0,
+ "eval_runtime": 85.8128,
+ "eval_samples_per_second": 16.023,
+ "eval_steps_per_second": 2.004,
+ "step": 2420
+ },
+ {
+ "entropy": 0.1534628233872354,
+ "epoch": 6.069738480697385,
+ "grad_norm": 0.710133969783783,
+ "learning_rate": 9.088662772316508e-05,
+ "loss": 0.09078952670097351,
+ "mean_token_accuracy": 0.9678447999060154,
+ "num_tokens": 5697633.0,
+ "step": 2440
+ },
+ {
+ "epoch": 6.069738480697385,
+ "eval_entropy": 0.28208133101809857,
+ "eval_loss": 0.7636417150497437,
+ "eval_mean_token_accuracy": 0.8494061477655588,
+ "eval_num_tokens": 5697633.0,
+ "eval_runtime": 85.9724,
+ "eval_samples_per_second": 15.994,
+ "eval_steps_per_second": 2.001,
+ "step": 2440
+ },
+ {
+ "entropy": 0.16151462448760867,
+ "epoch": 6.119551681195516,
+ "grad_norm": 0.5793812274932861,
+ "learning_rate": 8.896362400308028e-05,
+ "loss": 0.09545697569847107,
+ "mean_token_accuracy": 0.9671573750674725,
+ "num_tokens": 5745090.0,
+ "step": 2460
+ },
+ {
+ "epoch": 6.119551681195516,
+ "eval_entropy": 0.2833245605403601,
+ "eval_loss": 0.7402405738830566,
+ "eval_mean_token_accuracy": 0.8503523728875226,
+ "eval_num_tokens": 5745090.0,
+ "eval_runtime": 85.5461,
+ "eval_samples_per_second": 16.073,
+ "eval_steps_per_second": 2.011,
+ "step": 2460
+ },
+ {
+ "entropy": 0.15203177919611335,
+ "epoch": 6.169364881693649,
+ "grad_norm": 0.4251123368740082,
+ "learning_rate": 8.704791146635483e-05,
+ "loss": 0.09420782327651978,
+ "mean_token_accuracy": 0.9677386932075024,
+ "num_tokens": 5790333.0,
+ "step": 2480
+ },
+ {
+ "epoch": 6.169364881693649,
+ "eval_entropy": 0.28572545962971313,
+ "eval_loss": 0.735416829586029,
+ "eval_mean_token_accuracy": 0.8487084663884584,
+ "eval_num_tokens": 5790333.0,
+ "eval_runtime": 85.4801,
+ "eval_samples_per_second": 16.086,
+ "eval_steps_per_second": 2.012,
+ "step": 2480
+ },
+ {
+ "entropy": 0.15587336672469973,
+ "epoch": 6.219178082191781,
+ "grad_norm": 0.4357028007507324,
+ "learning_rate": 8.514006786576085e-05,
+ "loss": 0.09429320096969604,
+ "mean_token_accuracy": 0.9682952925562859,
+ "num_tokens": 5837321.0,
+ "step": 2500
+ },
+ {
+ "epoch": 6.219178082191781,
+ "eval_entropy": 0.2859006894882335,
+ "eval_loss": 0.7347224950790405,
+ "eval_mean_token_accuracy": 0.8501905518215757,
+ "eval_num_tokens": 5837321.0,
+ "eval_runtime": 85.7578,
+ "eval_samples_per_second": 16.034,
+ "eval_steps_per_second": 2.006,
+ "step": 2500
+ },
+ {
+ "entropy": 0.15765639198943973,
+ "epoch": 6.268991282689913,
+ "grad_norm": 0.47331130504608154,
+ "learning_rate": 8.324066858090663e-05,
+ "loss": 0.09571113586425781,
+ "mean_token_accuracy": 0.9683481335639954,
+ "num_tokens": 5884398.0,
+ "step": 2520
+ },
+ {
+ "epoch": 6.268991282689913,
+ "eval_entropy": 0.29231513846059176,
+ "eval_loss": 0.7392512559890747,
+ "eval_mean_token_accuracy": 0.8486633983462356,
+ "eval_num_tokens": 5884398.0,
+ "eval_runtime": 85.7846,
+ "eval_samples_per_second": 16.029,
+ "eval_steps_per_second": 2.005,
+ "step": 2520
+ },
+ {
+ "entropy": 0.16176860257983208,
+ "epoch": 6.318804483188045,
+ "grad_norm": 0.6142018437385559,
+ "learning_rate": 8.135028644470992e-05,
+ "loss": 0.09486144185066223,
+ "mean_token_accuracy": 0.9682316601276397,
+ "num_tokens": 5929876.0,
+ "step": 2540
+ },
+ {
+ "epoch": 6.318804483188045,
+ "eval_entropy": 0.2851274753379267,
+ "eval_loss": 0.7520816922187805,
+ "eval_mean_token_accuracy": 0.8501113649717597,
+ "eval_num_tokens": 5929876.0,
+ "eval_runtime": 85.9425,
+ "eval_samples_per_second": 15.999,
+ "eval_steps_per_second": 2.001,
+ "step": 2540
+ },
+ {
+ "entropy": 0.15404034564271568,
+ "epoch": 6.3686176836861765,
+ "grad_norm": 0.6051287651062012,
+ "learning_rate": 7.946949157063964e-05,
+ "loss": 0.09280472993850708,
+ "mean_token_accuracy": 0.9684635892510414,
+ "num_tokens": 5978490.0,
+ "step": 2560
+ },
+ {
+ "epoch": 6.3686176836861765,
+ "eval_entropy": 0.28802703563557114,
+ "eval_loss": 0.7439162135124207,
+ "eval_mean_token_accuracy": 0.8499851770872293,
+ "eval_num_tokens": 5978490.0,
+ "eval_runtime": 86.0703,
+ "eval_samples_per_second": 15.975,
+ "eval_steps_per_second": 1.998,
+ "step": 2560
+ },
+ {
+ "entropy": 0.15343588953837753,
+ "epoch": 6.418430884184309,
+ "grad_norm": 0.4823743402957916,
+ "learning_rate": 7.759885118077701e-05,
+ "loss": 0.09000591039657593,
+ "mean_token_accuracy": 0.9699928767979145,
+ "num_tokens": 6025380.0,
+ "step": 2580
+ },
+ {
+ "epoch": 6.418430884184309,
+ "eval_entropy": 0.2795634938533916,
+ "eval_loss": 0.7647850513458252,
+ "eval_mean_token_accuracy": 0.8503464397995971,
+ "eval_num_tokens": 6025380.0,
+ "eval_runtime": 85.8886,
+ "eval_samples_per_second": 16.009,
+ "eval_steps_per_second": 2.003,
+ "step": 2580
+ },
+ {
+ "entropy": 0.15740026142448188,
+ "epoch": 6.468244084682441,
+ "grad_norm": 0.5082696676254272,
+ "learning_rate": 7.57389294347494e-05,
+ "loss": 0.09191849827766418,
+ "mean_token_accuracy": 0.9692809768021107,
+ "num_tokens": 6073349.0,
+ "step": 2600
+ },
+ {
+ "epoch": 6.468244084682441,
+ "eval_entropy": 0.2913342311458532,
+ "eval_loss": 0.7518694996833801,
+ "eval_mean_token_accuracy": 0.8483168302580367,
+ "eval_num_tokens": 6073349.0,
+ "eval_runtime": 85.5761,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.01,
+ "step": 2600
+ },
+ {
+ "entropy": 0.15922069251537324,
+ "epoch": 6.518057285180573,
+ "grad_norm": 0.3995199501514435,
+ "learning_rate": 7.389028725958736e-05,
+ "loss": 0.09584367871284485,
+ "mean_token_accuracy": 0.9685114495456218,
+ "num_tokens": 6118148.0,
+ "step": 2620
+ },
+ {
+ "epoch": 6.518057285180573,
+ "eval_entropy": 0.2863075934177221,
+ "eval_loss": 0.7539381384849548,
+ "eval_mean_token_accuracy": 0.8507507083027862,
+ "eval_num_tokens": 6118148.0,
+ "eval_runtime": 86.112,
+ "eval_samples_per_second": 15.968,
+ "eval_steps_per_second": 1.997,
+ "step": 2620
+ },
+ {
+ "entropy": 0.16197575423866512,
+ "epoch": 6.567870485678705,
+ "grad_norm": 0.534295380115509,
+ "learning_rate": 7.205348218055678e-05,
+ "loss": 0.0961170256137848,
+ "mean_token_accuracy": 0.9674530044198036,
+ "num_tokens": 6165523.0,
+ "step": 2640
+ },
+ {
+ "epoch": 6.567870485678705,
+ "eval_entropy": 0.29021967315050057,
+ "eval_loss": 0.751198947429657,
+ "eval_mean_token_accuracy": 0.8509796344956686,
+ "eval_num_tokens": 6165523.0,
+ "eval_runtime": 85.7958,
+ "eval_samples_per_second": 16.026,
+ "eval_steps_per_second": 2.005,
+ "step": 2640
+ },
+ {
+ "entropy": 0.15261746793985367,
+ "epoch": 6.617683686176837,
+ "grad_norm": 0.5391237139701843,
+ "learning_rate": 7.022906815301673e-05,
+ "loss": 0.0926026999950409,
+ "mean_token_accuracy": 0.9695659473538398,
+ "num_tokens": 6216232.0,
+ "step": 2660
+ },
+ {
+ "epoch": 6.617683686176837,
+ "eval_entropy": 0.29128045216202736,
+ "eval_loss": 0.7450292110443115,
+ "eval_mean_token_accuracy": 0.8498771443616512,
+ "eval_num_tokens": 6216232.0,
+ "eval_runtime": 86.3963,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 2660
+ },
+ {
+ "entropy": 0.16164180357009172,
+ "epoch": 6.667496886674969,
+ "grad_norm": 0.5767946243286133,
+ "learning_rate": 6.841759539535419e-05,
+ "loss": 0.09291981458663941,
+ "mean_token_accuracy": 0.9687136687338352,
+ "num_tokens": 6264807.0,
+ "step": 2680
+ },
+ {
+ "epoch": 6.667496886674969,
+ "eval_entropy": 0.2897637223088464,
+ "eval_loss": 0.7503410577774048,
+ "eval_mean_token_accuracy": 0.8503315164599308,
+ "eval_num_tokens": 6264807.0,
+ "eval_runtime": 86.0653,
+ "eval_samples_per_second": 15.976,
+ "eval_steps_per_second": 1.998,
+ "step": 2680
+ },
+ {
+ "entropy": 0.17062523355707526,
+ "epoch": 6.717310087173101,
+ "grad_norm": 0.4974168539047241,
+ "learning_rate": 6.661961022304563e-05,
+ "loss": 0.09713236689567566,
+ "mean_token_accuracy": 0.9661971725523472,
+ "num_tokens": 6308819.0,
+ "step": 2700
+ },
+ {
+ "epoch": 6.717310087173101,
+ "eval_entropy": 0.2765843396963075,
+ "eval_loss": 0.7604002356529236,
+ "eval_mean_token_accuracy": 0.8521115277395692,
+ "eval_num_tokens": 6308819.0,
+ "eval_runtime": 86.1676,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 2700
+ },
+ {
+ "entropy": 0.17544092936441302,
+ "epoch": 6.767123287671232,
+ "grad_norm": 0.5523537993431091,
+ "learning_rate": 6.483565488389582e-05,
+ "loss": 0.09709116220474243,
+ "mean_token_accuracy": 0.9650957375764847,
+ "num_tokens": 6352548.0,
+ "step": 2720
+ },
+ {
+ "epoch": 6.767123287671232,
+ "eval_entropy": 0.27939334659035814,
+ "eval_loss": 0.7534670829772949,
+ "eval_mean_token_accuracy": 0.851230604010959,
+ "eval_num_tokens": 6352548.0,
+ "eval_runtime": 86.2913,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 2720
+ },
+ {
+ "entropy": 0.15991022661328316,
+ "epoch": 6.816936488169365,
+ "grad_norm": 0.478551983833313,
+ "learning_rate": 6.306626739450311e-05,
+ "loss": 0.09564646482467651,
+ "mean_token_accuracy": 0.9679084822535515,
+ "num_tokens": 6397720.0,
+ "step": 2740
+ },
+ {
+ "epoch": 6.816936488169365,
+ "eval_entropy": 0.27878295491601146,
+ "eval_loss": 0.7519959211349487,
+ "eval_mean_token_accuracy": 0.8510654949864676,
+ "eval_num_tokens": 6397720.0,
+ "eval_runtime": 85.9109,
+ "eval_samples_per_second": 16.005,
+ "eval_steps_per_second": 2.002,
+ "step": 2740
+ },
+ {
+ "entropy": 0.16824879590421915,
+ "epoch": 6.866749688667497,
+ "grad_norm": 0.6681098937988281,
+ "learning_rate": 6.131198137800108e-05,
+ "loss": 0.0962279736995697,
+ "mean_token_accuracy": 0.966830012947321,
+ "num_tokens": 6442821.0,
+ "step": 2760
+ },
+ {
+ "epoch": 6.866749688667497,
+ "eval_entropy": 0.2834690434121808,
+ "eval_loss": 0.751922070980072,
+ "eval_mean_token_accuracy": 0.8521237577809844,
+ "eval_num_tokens": 6442821.0,
+ "eval_runtime": 86.3618,
+ "eval_samples_per_second": 15.921,
+ "eval_steps_per_second": 1.992,
+ "step": 2760
+ },
+ {
+ "entropy": 0.1518704930320382,
+ "epoch": 6.916562889165629,
+ "grad_norm": 0.5201290249824524,
+ "learning_rate": 5.957332590312513e-05,
+ "loss": 0.09010660648345947,
+ "mean_token_accuracy": 0.9693463340401649,
+ "num_tokens": 6494118.0,
+ "step": 2780
+ },
+ {
+ "epoch": 6.916562889165629,
+ "eval_entropy": 0.28485129617674404,
+ "eval_loss": 0.7452457547187805,
+ "eval_mean_token_accuracy": 0.8512036796919135,
+ "eval_num_tokens": 6494118.0,
+ "eval_runtime": 86.4524,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2780
+ },
+ {
+ "entropy": 0.15512610590085388,
+ "epoch": 6.966376089663761,
+ "grad_norm": 0.42802050709724426,
+ "learning_rate": 5.785082532465233e-05,
+ "loss": 0.09320432543754578,
+ "mean_token_accuracy": 0.9686134628951549,
+ "num_tokens": 6540175.0,
+ "step": 2800
+ },
+ {
+ "epoch": 6.966376089663761,
+ "eval_entropy": 0.27554594526110693,
+ "eval_loss": 0.7644653916358948,
+ "eval_mean_token_accuracy": 0.8513738523389018,
+ "eval_num_tokens": 6540175.0,
+ "eval_runtime": 85.7609,
+ "eval_samples_per_second": 16.033,
+ "eval_steps_per_second": 2.006,
+ "step": 2800
+ },
+ {
+ "entropy": 0.17524497526196334,
+ "epoch": 7.01494396014944,
+ "grad_norm": 0.3330269157886505,
+ "learning_rate": 5.6144999125263545e-05,
+ "loss": 0.0895616888999939,
+ "mean_token_accuracy": 0.9682766932707566,
+ "num_tokens": 6583767.0,
+ "step": 2820
+ },
+ {
+ "epoch": 7.01494396014944,
+ "eval_entropy": 0.2735865569218647,
+ "eval_loss": 0.768479585647583,
+ "eval_mean_token_accuracy": 0.8503459383581959,
+ "eval_num_tokens": 6583767.0,
+ "eval_runtime": 85.7162,
+ "eval_samples_per_second": 16.041,
+ "eval_steps_per_second": 2.007,
+ "step": 2820
+ },
+ {
+ "entropy": 0.1403565663844347,
+ "epoch": 7.064757160647572,
+ "grad_norm": 0.35613498091697693,
+ "learning_rate": 5.4456361758874235e-05,
+ "loss": 0.07551313638687134,
+ "mean_token_accuracy": 0.9739301167428493,
+ "num_tokens": 6627672.0,
+ "step": 2840
+ },
+ {
+ "epoch": 7.064757160647572,
+ "eval_entropy": 0.25941789089593775,
+ "eval_loss": 0.8209511637687683,
+ "eval_mean_token_accuracy": 0.8505055855873019,
+ "eval_num_tokens": 6627672.0,
+ "eval_runtime": 86.0943,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 2840
+ },
+ {
+ "entropy": 0.13500106502324344,
+ "epoch": 7.114570361145703,
+ "grad_norm": 0.34418627619743347,
+ "learning_rate": 5.2785422495482234e-05,
+ "loss": 0.07293946146965027,
+ "mean_token_accuracy": 0.9747208289802074,
+ "num_tokens": 6672946.0,
+ "step": 2860
+ },
+ {
+ "epoch": 7.114570361145703,
+ "eval_entropy": 0.26482899772912954,
+ "eval_loss": 0.798904538154602,
+ "eval_mean_token_accuracy": 0.8511530233677044,
+ "eval_num_tokens": 6672946.0,
+ "eval_runtime": 85.7915,
+ "eval_samples_per_second": 16.027,
+ "eval_steps_per_second": 2.005,
+ "step": 2860
+ },
+ {
+ "entropy": 0.13127502552233636,
+ "epoch": 7.164383561643835,
+ "grad_norm": 0.4638441503047943,
+ "learning_rate": 5.113268526757892e-05,
+ "loss": 0.07121461629867554,
+ "mean_token_accuracy": 0.9756786689162255,
+ "num_tokens": 6718582.0,
+ "step": 2880
+ },
+ {
+ "epoch": 7.164383561643835,
+ "eval_entropy": 0.2645381211714689,
+ "eval_loss": 0.809101939201355,
+ "eval_mean_token_accuracy": 0.8514727898115335,
+ "eval_num_tokens": 6718582.0,
+ "eval_runtime": 85.84,
+ "eval_samples_per_second": 16.018,
+ "eval_steps_per_second": 2.004,
+ "step": 2880
+ },
+ {
+ "entropy": 0.1331390908919275,
+ "epoch": 7.214196762141968,
+ "grad_norm": 0.40206775069236755,
+ "learning_rate": 4.949864851817007e-05,
+ "loss": 0.07188264131546021,
+ "mean_token_accuracy": 0.9755406074225903,
+ "num_tokens": 6764387.0,
+ "step": 2900
+ },
+ {
+ "epoch": 7.214196762141968,
+ "eval_entropy": 0.26244733283339544,
+ "eval_loss": 0.8143188953399658,
+ "eval_mean_token_accuracy": 0.8514358189909957,
+ "eval_num_tokens": 6764387.0,
+ "eval_runtime": 85.8546,
+ "eval_samples_per_second": 16.015,
+ "eval_steps_per_second": 2.003,
+ "step": 2900
+ },
+ {
+ "entropy": 0.13647331558167936,
+ "epoch": 7.2640099626401,
+ "grad_norm": 0.26405787467956543,
+ "learning_rate": 4.788380505045224e-05,
+ "loss": 0.07412450313568116,
+ "mean_token_accuracy": 0.9744274213910102,
+ "num_tokens": 6809678.0,
+ "step": 2920
+ },
+ {
+ "epoch": 7.2640099626401,
+ "eval_entropy": 0.2626111418182074,
+ "eval_loss": 0.8111525177955627,
+ "eval_mean_token_accuracy": 0.8512121695418691,
+ "eval_num_tokens": 6809678.0,
+ "eval_runtime": 85.9626,
+ "eval_samples_per_second": 15.995,
+ "eval_steps_per_second": 2.001,
+ "step": 2920
+ },
+ {
+ "entropy": 0.12644002586603165,
+ "epoch": 7.313823163138232,
+ "grad_norm": 0.27514681220054626,
+ "learning_rate": 4.6288641879189884e-05,
+ "loss": 0.06807711124420165,
+ "mean_token_accuracy": 0.9760703906416893,
+ "num_tokens": 6860750.0,
+ "step": 2940
+ },
+ {
+ "epoch": 7.313823163138232,
+ "eval_entropy": 0.26096762734097106,
+ "eval_loss": 0.8184595108032227,
+ "eval_mean_token_accuracy": 0.8501476153384807,
+ "eval_num_tokens": 6860750.0,
+ "eval_runtime": 85.9521,
+ "eval_samples_per_second": 15.997,
+ "eval_steps_per_second": 2.001,
+ "step": 2940
+ },
+ {
+ "entropy": 0.13920630998909472,
+ "epoch": 7.363636363636363,
+ "grad_norm": 0.23584705591201782,
+ "learning_rate": 4.4713640083838604e-05,
+ "loss": 0.07301607131958007,
+ "mean_token_accuracy": 0.9745715200901032,
+ "num_tokens": 6907092.0,
+ "step": 2960
+ },
+ {
+ "epoch": 7.363636363636363,
+ "eval_entropy": 0.2612536767021168,
+ "eval_loss": 0.8116245269775391,
+ "eval_mean_token_accuracy": 0.8510967350976412,
+ "eval_num_tokens": 6907092.0,
+ "eval_runtime": 85.6373,
+ "eval_samples_per_second": 16.056,
+ "eval_steps_per_second": 2.008,
+ "step": 2960
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.9121676695029146e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2980/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2980/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2980/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2980/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2980/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2980/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2980/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2980/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2980/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2980/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2980/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2980/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2980/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2980/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..8a0d0b674e301609eeb53f810a9d9b294772c7cf
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-2980/trainer_state.json
@@ -0,0 +1,3163 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 7.4134495641344955,
+ "eval_steps": 20,
+ "global_step": 2980,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ },
+ {
+ "entropy": 0.3193941755220294,
+ "epoch": 4.5280199252802,
+ "grad_norm": 0.8281906843185425,
+ "learning_rate": 0.0001509111761786888,
+ "loss": 0.23936262130737304,
+ "mean_token_accuracy": 0.9201708927750587,
+ "num_tokens": 4244423.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.5280199252802,
+ "eval_entropy": 0.38704028864239537,
+ "eval_loss": 0.6006569266319275,
+ "eval_mean_token_accuracy": 0.8502406720505205,
+ "eval_num_tokens": 4244423.0,
+ "eval_runtime": 86.8059,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1820
+ },
+ {
+ "entropy": 0.3164879363030195,
+ "epoch": 4.577833125778331,
+ "grad_norm": 0.7892968654632568,
+ "learning_rate": 0.00014905346557909867,
+ "loss": 0.24541733264923096,
+ "mean_token_accuracy": 0.9175932116806507,
+ "num_tokens": 4289773.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.577833125778331,
+ "eval_entropy": 0.38861122120951497,
+ "eval_loss": 0.6115967631340027,
+ "eval_mean_token_accuracy": 0.849471275196519,
+ "eval_num_tokens": 4289773.0,
+ "eval_runtime": 86.2946,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1840
+ },
+ {
+ "entropy": 0.3051785985007882,
+ "epoch": 4.627646326276463,
+ "grad_norm": 0.8109654188156128,
+ "learning_rate": 0.0001471849238862319,
+ "loss": 0.23433220386505127,
+ "mean_token_accuracy": 0.9206570319831371,
+ "num_tokens": 4336894.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.627646326276463,
+ "eval_entropy": 0.37162452295076015,
+ "eval_loss": 0.6184061765670776,
+ "eval_mean_token_accuracy": 0.8501173268223918,
+ "eval_num_tokens": 4336894.0,
+ "eval_runtime": 86.6865,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1860
+ },
+ {
+ "entropy": 0.3168198253959417,
+ "epoch": 4.677459526774595,
+ "grad_norm": 0.9512342214584351,
+ "learning_rate": 0.0001453061146267775,
+ "loss": 0.23832404613494873,
+ "mean_token_accuracy": 0.9197044663131237,
+ "num_tokens": 4382947.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.677459526774595,
+ "eval_entropy": 0.3845940856912801,
+ "eval_loss": 0.606762707233429,
+ "eval_mean_token_accuracy": 0.8504838194957999,
+ "eval_num_tokens": 4382947.0,
+ "eval_runtime": 86.5175,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 1880
+ },
+ {
+ "entropy": 0.30791807882487776,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 0.8123113512992859,
+ "learning_rate": 0.00014341760442398248,
+ "loss": 0.2395785331726074,
+ "mean_token_accuracy": 0.918928150832653,
+ "num_tokens": 4433050.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.7272727272727275,
+ "eval_entropy": 0.39762327222283494,
+ "eval_loss": 0.5994202494621277,
+ "eval_mean_token_accuracy": 0.8509274201337681,
+ "eval_num_tokens": 4433050.0,
+ "eval_runtime": 86.2873,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.993,
+ "step": 1900
+ },
+ {
+ "entropy": 0.3021434534341097,
+ "epoch": 4.777085927770859,
+ "grad_norm": 0.731787383556366,
+ "learning_rate": 0.000141519962826766,
+ "loss": 0.23494718074798585,
+ "mean_token_accuracy": 0.9201403826475143,
+ "num_tokens": 4483598.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.777085927770859,
+ "eval_entropy": 0.3827026732439219,
+ "eval_loss": 0.5995895862579346,
+ "eval_mean_token_accuracy": 0.851468373523202,
+ "eval_num_tokens": 4483598.0,
+ "eval_runtime": 86.3006,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 1920
+ },
+ {
+ "entropy": 0.31626159623265265,
+ "epoch": 4.826899128268991,
+ "grad_norm": 0.8848487138748169,
+ "learning_rate": 0.00013961376213795132,
+ "loss": 0.2439030647277832,
+ "mean_token_accuracy": 0.9196575872600079,
+ "num_tokens": 4529201.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.826899128268991,
+ "eval_entropy": 0.388698436839636,
+ "eval_loss": 0.6000174283981323,
+ "eval_mean_token_accuracy": 0.8518068187458571,
+ "eval_num_tokens": 4529201.0,
+ "eval_runtime": 86.8979,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.979,
+ "step": 1940
+ },
+ {
+ "entropy": 0.30520407035946845,
+ "epoch": 4.876712328767123,
+ "grad_norm": 0.8532460927963257,
+ "learning_rate": 0.00013769957724166695,
+ "loss": 0.23458616733551024,
+ "mean_token_accuracy": 0.9221912942826748,
+ "num_tokens": 4578167.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.876712328767123,
+ "eval_entropy": 0.38777847102908203,
+ "eval_loss": 0.6004981398582458,
+ "eval_mean_token_accuracy": 0.8516481768253238,
+ "eval_num_tokens": 4578167.0,
+ "eval_runtime": 87.0777,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.975,
+ "step": 1960
+ },
+ {
+ "entropy": 0.3226448342204094,
+ "epoch": 4.926525529265255,
+ "grad_norm": 0.6945561766624451,
+ "learning_rate": 0.0001357779854299694,
+ "loss": 0.24048397541046143,
+ "mean_token_accuracy": 0.9195300146937371,
+ "num_tokens": 4622316.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.926525529265255,
+ "eval_entropy": 0.38581624263247777,
+ "eval_loss": 0.6029234528541565,
+ "eval_mean_token_accuracy": 0.8514213260523108,
+ "eval_num_tokens": 4622316.0,
+ "eval_runtime": 85.8729,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 1980
+ },
+ {
+ "entropy": 0.3051655298098922,
+ "epoch": 4.976338729763388,
+ "grad_norm": 0.7976452708244324,
+ "learning_rate": 0.00013384956622874001,
+ "loss": 0.23584742546081544,
+ "mean_token_accuracy": 0.9216851457953453,
+ "num_tokens": 4670746.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.976338729763388,
+ "eval_entropy": 0.37913159246361533,
+ "eval_loss": 0.6057604551315308,
+ "eval_mean_token_accuracy": 0.8525801203971686,
+ "eval_num_tokens": 4670746.0,
+ "eval_runtime": 86.1145,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2000
+ },
+ {
+ "entropy": 0.27438195240803254,
+ "epoch": 5.024906600249066,
+ "grad_norm": 0.6729586124420166,
+ "learning_rate": 0.0001319149012229075,
+ "loss": 0.19775952100753785,
+ "mean_token_accuracy": 0.9339428559327737,
+ "num_tokens": 4716176.0,
+ "step": 2020
+ },
+ {
+ "epoch": 5.024906600249066,
+ "eval_entropy": 0.3448961910813354,
+ "eval_loss": 0.6750120520591736,
+ "eval_mean_token_accuracy": 0.8487970232963562,
+ "eval_num_tokens": 4716176.0,
+ "eval_runtime": 86.1169,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2020
+ },
+ {
+ "entropy": 0.21423916313797237,
+ "epoch": 5.074719800747198,
+ "grad_norm": 0.6934391856193542,
+ "learning_rate": 0.00012997457388105022,
+ "loss": 0.1439570426940918,
+ "mean_token_accuracy": 0.9528236843645572,
+ "num_tokens": 4763269.0,
+ "step": 2040
+ },
+ {
+ "epoch": 5.074719800747198,
+ "eval_entropy": 0.3570949243771475,
+ "eval_loss": 0.6465504169464111,
+ "eval_mean_token_accuracy": 0.8490785547467166,
+ "eval_num_tokens": 4763269.0,
+ "eval_runtime": 85.9574,
+ "eval_samples_per_second": 15.996,
+ "eval_steps_per_second": 2.001,
+ "step": 2040
+ },
+ {
+ "entropy": 0.20838565267622472,
+ "epoch": 5.12453300124533,
+ "grad_norm": 0.7286986112594604,
+ "learning_rate": 0.00012802916937942972,
+ "loss": 0.14467307329177856,
+ "mean_token_accuracy": 0.950994835793972,
+ "num_tokens": 4809047.0,
+ "step": 2060
+ },
+ {
+ "epoch": 5.12453300124533,
+ "eval_entropy": 0.3452463157821533,
+ "eval_loss": 0.6705958843231201,
+ "eval_mean_token_accuracy": 0.8490352796953778,
+ "eval_num_tokens": 4809047.0,
+ "eval_runtime": 86.228,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 2060
+ },
+ {
+ "entropy": 0.20453082229942082,
+ "epoch": 5.174346201743462,
+ "grad_norm": 0.7515555620193481,
+ "learning_rate": 0.00012607927442550974,
+ "loss": 0.13732000589370727,
+ "mean_token_accuracy": 0.9537357829511166,
+ "num_tokens": 4857965.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.174346201743462,
+ "eval_entropy": 0.32431264914745506,
+ "eval_loss": 0.6743043065071106,
+ "eval_mean_token_accuracy": 0.8504878629085629,
+ "eval_num_tokens": 4857965.0,
+ "eval_runtime": 86.5948,
+ "eval_samples_per_second": 15.879,
+ "eval_steps_per_second": 1.986,
+ "step": 2080
+ },
+ {
+ "entropy": 0.21812320686876774,
+ "epoch": 5.224159402241594,
+ "grad_norm": 0.9093465209007263,
+ "learning_rate": 0.0001241254770810132,
+ "loss": 0.14311420917510986,
+ "mean_token_accuracy": 0.9514068141579628,
+ "num_tokens": 4905151.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.224159402241594,
+ "eval_entropy": 0.33086285835435225,
+ "eval_loss": 0.6676449179649353,
+ "eval_mean_token_accuracy": 0.8505287662495015,
+ "eval_num_tokens": 4905151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 2100
+ },
+ {
+ "entropy": 0.2180163251236081,
+ "epoch": 5.273972602739726,
+ "grad_norm": 0.6703007221221924,
+ "learning_rate": 0.00012216836658457075,
+ "loss": 0.14803968667984008,
+ "mean_token_accuracy": 0.9521303348243236,
+ "num_tokens": 4947072.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.273972602739726,
+ "eval_entropy": 0.33162341708707255,
+ "eval_loss": 0.6658875942230225,
+ "eval_mean_token_accuracy": 0.8500757605530495,
+ "eval_num_tokens": 4947072.0,
+ "eval_runtime": 86.6296,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 2120
+ },
+ {
+ "entropy": 0.22511130161583423,
+ "epoch": 5.323785803237858,
+ "grad_norm": 0.8078880906105042,
+ "learning_rate": 0.00012020853317401455,
+ "loss": 0.15228408575057983,
+ "mean_token_accuracy": 0.947144789993763,
+ "num_tokens": 4991974.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.323785803237858,
+ "eval_entropy": 0.3354601170434508,
+ "eval_loss": 0.6677829623222351,
+ "eval_mean_token_accuracy": 0.8482600024273229,
+ "eval_num_tokens": 4991974.0,
+ "eval_runtime": 86.4689,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.989,
+ "step": 2140
+ },
+ {
+ "entropy": 0.2244176059961319,
+ "epoch": 5.37359900373599,
+ "grad_norm": 0.9636075496673584,
+ "learning_rate": 0.00011824656790837037,
+ "loss": 0.15260883569717407,
+ "mean_token_accuracy": 0.9471467643976211,
+ "num_tokens": 5038400.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.37359900373599,
+ "eval_entropy": 0.3381616926297199,
+ "eval_loss": 0.6694412231445312,
+ "eval_mean_token_accuracy": 0.8482369603805764,
+ "eval_num_tokens": 5038400.0,
+ "eval_runtime": 86.4147,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 2160
+ },
+ {
+ "entropy": 0.22982364390045404,
+ "epoch": 5.423412204234122,
+ "grad_norm": 0.775401771068573,
+ "learning_rate": 0.00011628306248960262,
+ "loss": 0.15140302181243898,
+ "mean_token_accuracy": 0.9492553934454918,
+ "num_tokens": 5083166.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.423412204234122,
+ "eval_entropy": 0.3305150235808173,
+ "eval_loss": 0.6717822551727295,
+ "eval_mean_token_accuracy": 0.8489849723355715,
+ "eval_num_tokens": 5083166.0,
+ "eval_runtime": 86.4728,
+ "eval_samples_per_second": 15.901,
+ "eval_steps_per_second": 1.989,
+ "step": 2180
+ },
+ {
+ "entropy": 0.21448935717344284,
+ "epoch": 5.473225404732254,
+ "grad_norm": 0.6575281023979187,
+ "learning_rate": 0.00011431860908416465,
+ "loss": 0.1452319622039795,
+ "mean_token_accuracy": 0.9505287684500218,
+ "num_tokens": 5135109.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.473225404732254,
+ "eval_entropy": 0.3488145174328671,
+ "eval_loss": 0.6612305641174316,
+ "eval_mean_token_accuracy": 0.8492907808963642,
+ "eval_num_tokens": 5135109.0,
+ "eval_runtime": 86.6927,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 2200
+ },
+ {
+ "entropy": 0.23091202937066554,
+ "epoch": 5.523038605230386,
+ "grad_norm": 0.8909686207771301,
+ "learning_rate": 0.00011235380014440985,
+ "loss": 0.15150139331817628,
+ "mean_token_accuracy": 0.9497875183820724,
+ "num_tokens": 5180138.0,
+ "step": 2220
+ },
+ {
+ "epoch": 5.523038605230386,
+ "eval_entropy": 0.3268539015810157,
+ "eval_loss": 0.6667542457580566,
+ "eval_mean_token_accuracy": 0.8499062903398691,
+ "eval_num_tokens": 5180138.0,
+ "eval_runtime": 86.4644,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 2220
+ },
+ {
+ "entropy": 0.2227974807843566,
+ "epoch": 5.572851805728518,
+ "grad_norm": 0.6180275082588196,
+ "learning_rate": 0.0001103892282299158,
+ "loss": 0.1491069197654724,
+ "mean_token_accuracy": 0.9488144010305405,
+ "num_tokens": 5226864.0,
+ "step": 2240
+ },
+ {
+ "epoch": 5.572851805728518,
+ "eval_entropy": 0.3346347655494546,
+ "eval_loss": 0.6665948629379272,
+ "eval_mean_token_accuracy": 0.8499961893918903,
+ "eval_num_tokens": 5226864.0,
+ "eval_runtime": 87.0548,
+ "eval_samples_per_second": 15.795,
+ "eval_steps_per_second": 1.976,
+ "step": 2240
+ },
+ {
+ "entropy": 0.21368421968072654,
+ "epoch": 5.62266500622665,
+ "grad_norm": 0.6004369258880615,
+ "learning_rate": 0.00010842548582877651,
+ "loss": 0.14485255479812623,
+ "mean_token_accuracy": 0.9502056457102299,
+ "num_tokens": 5276602.0,
+ "step": 2260
+ },
+ {
+ "epoch": 5.62266500622665,
+ "eval_entropy": 0.32753298804163933,
+ "eval_loss": 0.6680151224136353,
+ "eval_mean_token_accuracy": 0.8515451086121936,
+ "eval_num_tokens": 5276602.0,
+ "eval_runtime": 86.8524,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.98,
+ "step": 2260
+ },
+ {
+ "entropy": 0.2103635374456644,
+ "epoch": 5.672478206724782,
+ "grad_norm": 0.699174702167511,
+ "learning_rate": 0.00010646316517891613,
+ "loss": 0.14297772645950318,
+ "mean_token_accuracy": 0.9512537539005279,
+ "num_tokens": 5323718.0,
+ "step": 2280
+ },
+ {
+ "epoch": 5.672478206724782,
+ "eval_entropy": 0.32966585959806,
+ "eval_loss": 0.675578773021698,
+ "eval_mean_token_accuracy": 0.8509623023659684,
+ "eval_num_tokens": 5323718.0,
+ "eval_runtime": 86.4518,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2280
+ },
+ {
+ "entropy": 0.22516900151968003,
+ "epoch": 5.722291407222914,
+ "grad_norm": 0.6637354493141174,
+ "learning_rate": 0.00010450285808947797,
+ "loss": 0.15202572345733642,
+ "mean_token_accuracy": 0.9482452072203159,
+ "num_tokens": 5369039.0,
+ "step": 2300
+ },
+ {
+ "epoch": 5.722291407222914,
+ "eval_entropy": 0.3369456917740578,
+ "eval_loss": 0.6697061061859131,
+ "eval_mean_token_accuracy": 0.848603522361711,
+ "eval_num_tokens": 5369039.0,
+ "eval_runtime": 86.6371,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.985,
+ "step": 2300
+ },
+ {
+ "entropy": 0.21841065725311637,
+ "epoch": 5.772104607721046,
+ "grad_norm": 0.7940268516540527,
+ "learning_rate": 0.00010254515576234297,
+ "loss": 0.14710167646408082,
+ "mean_token_accuracy": 0.9493498183786869,
+ "num_tokens": 5417029.0,
+ "step": 2320
+ },
+ {
+ "epoch": 5.772104607721046,
+ "eval_entropy": 0.3237486180177955,
+ "eval_loss": 0.6779657602310181,
+ "eval_mean_token_accuracy": 0.8500715313955794,
+ "eval_num_tokens": 5417029.0,
+ "eval_runtime": 86.1826,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 1.996,
+ "step": 2320
+ },
+ {
+ "entropy": 0.22146204356104135,
+ "epoch": 5.821917808219178,
+ "grad_norm": 0.9234833121299744,
+ "learning_rate": 0.00010059064861383132,
+ "loss": 0.14720046520233154,
+ "mean_token_accuracy": 0.9493872679769992,
+ "num_tokens": 5461671.0,
+ "step": 2340
+ },
+ {
+ "epoch": 5.821917808219178,
+ "eval_entropy": 0.32365207564692167,
+ "eval_loss": 0.6704005002975464,
+ "eval_mean_token_accuracy": 0.8507985760306203,
+ "eval_num_tokens": 5461671.0,
+ "eval_runtime": 86.5494,
+ "eval_samples_per_second": 15.887,
+ "eval_steps_per_second": 1.987,
+ "step": 2340
+ },
+ {
+ "entropy": 0.20934011954814197,
+ "epoch": 5.87173100871731,
+ "grad_norm": 0.5547503232955933,
+ "learning_rate": 9.863992609664084e-05,
+ "loss": 0.1464867353439331,
+ "mean_token_accuracy": 0.9503875687718392,
+ "num_tokens": 5509312.0,
+ "step": 2360
+ },
+ {
+ "epoch": 5.87173100871731,
+ "eval_entropy": 0.3330401429083458,
+ "eval_loss": 0.6659091114997864,
+ "eval_mean_token_accuracy": 0.8504848906467127,
+ "eval_num_tokens": 5509312.0,
+ "eval_runtime": 86.5855,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 2360
+ },
+ {
+ "entropy": 0.21678635366261007,
+ "epoch": 5.921544209215442,
+ "grad_norm": 0.570612907409668,
+ "learning_rate": 9.669357652207635e-05,
+ "loss": 0.14821385145187377,
+ "mean_token_accuracy": 0.9503940217196941,
+ "num_tokens": 5558196.0,
+ "step": 2380
+ },
+ {
+ "epoch": 5.921544209215442,
+ "eval_entropy": 0.3322022325077722,
+ "eval_loss": 0.6722489595413208,
+ "eval_mean_token_accuracy": 0.8489979422369669,
+ "eval_num_tokens": 5558196.0,
+ "eval_runtime": 86.2986,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 2380
+ },
+ {
+ "entropy": 0.20932920072227718,
+ "epoch": 5.971357409713574,
+ "grad_norm": 0.7879557609558105,
+ "learning_rate": 9.475218688262262e-05,
+ "loss": 0.14675841331481934,
+ "mean_token_accuracy": 0.9507176131010056,
+ "num_tokens": 5605400.0,
+ "step": 2400
+ },
+ {
+ "epoch": 5.971357409713574,
+ "eval_entropy": 0.3199348642902319,
+ "eval_loss": 0.6698136329650879,
+ "eval_mean_token_accuracy": 0.8514142130003419,
+ "eval_num_tokens": 5605400.0,
+ "eval_runtime": 85.8995,
+ "eval_samples_per_second": 16.007,
+ "eval_steps_per_second": 2.002,
+ "step": 2400
+ },
+ {
+ "entropy": 0.21032143919131693,
+ "epoch": 6.019925280199253,
+ "grad_norm": 0.5823076367378235,
+ "learning_rate": 9.281634267491569e-05,
+ "loss": 0.13322267532348633,
+ "mean_token_accuracy": 0.9550939072401096,
+ "num_tokens": 5648968.0,
+ "step": 2420
+ },
+ {
+ "epoch": 6.019925280199253,
+ "eval_entropy": 0.30206270117399303,
+ "eval_loss": 0.7093168497085571,
+ "eval_mean_token_accuracy": 0.8500627639681794,
+ "eval_num_tokens": 5648968.0,
+ "eval_runtime": 85.8128,
+ "eval_samples_per_second": 16.023,
+ "eval_steps_per_second": 2.004,
+ "step": 2420
+ },
+ {
+ "entropy": 0.1534628233872354,
+ "epoch": 6.069738480697385,
+ "grad_norm": 0.710133969783783,
+ "learning_rate": 9.088662772316508e-05,
+ "loss": 0.09078952670097351,
+ "mean_token_accuracy": 0.9678447999060154,
+ "num_tokens": 5697633.0,
+ "step": 2440
+ },
+ {
+ "epoch": 6.069738480697385,
+ "eval_entropy": 0.28208133101809857,
+ "eval_loss": 0.7636417150497437,
+ "eval_mean_token_accuracy": 0.8494061477655588,
+ "eval_num_tokens": 5697633.0,
+ "eval_runtime": 85.9724,
+ "eval_samples_per_second": 15.994,
+ "eval_steps_per_second": 2.001,
+ "step": 2440
+ },
+ {
+ "entropy": 0.16151462448760867,
+ "epoch": 6.119551681195516,
+ "grad_norm": 0.5793812274932861,
+ "learning_rate": 8.896362400308028e-05,
+ "loss": 0.09545697569847107,
+ "mean_token_accuracy": 0.9671573750674725,
+ "num_tokens": 5745090.0,
+ "step": 2460
+ },
+ {
+ "epoch": 6.119551681195516,
+ "eval_entropy": 0.2833245605403601,
+ "eval_loss": 0.7402405738830566,
+ "eval_mean_token_accuracy": 0.8503523728875226,
+ "eval_num_tokens": 5745090.0,
+ "eval_runtime": 85.5461,
+ "eval_samples_per_second": 16.073,
+ "eval_steps_per_second": 2.011,
+ "step": 2460
+ },
+ {
+ "entropy": 0.15203177919611335,
+ "epoch": 6.169364881693649,
+ "grad_norm": 0.4251123368740082,
+ "learning_rate": 8.704791146635483e-05,
+ "loss": 0.09420782327651978,
+ "mean_token_accuracy": 0.9677386932075024,
+ "num_tokens": 5790333.0,
+ "step": 2480
+ },
+ {
+ "epoch": 6.169364881693649,
+ "eval_entropy": 0.28572545962971313,
+ "eval_loss": 0.735416829586029,
+ "eval_mean_token_accuracy": 0.8487084663884584,
+ "eval_num_tokens": 5790333.0,
+ "eval_runtime": 85.4801,
+ "eval_samples_per_second": 16.086,
+ "eval_steps_per_second": 2.012,
+ "step": 2480
+ },
+ {
+ "entropy": 0.15587336672469973,
+ "epoch": 6.219178082191781,
+ "grad_norm": 0.4357028007507324,
+ "learning_rate": 8.514006786576085e-05,
+ "loss": 0.09429320096969604,
+ "mean_token_accuracy": 0.9682952925562859,
+ "num_tokens": 5837321.0,
+ "step": 2500
+ },
+ {
+ "epoch": 6.219178082191781,
+ "eval_entropy": 0.2859006894882335,
+ "eval_loss": 0.7347224950790405,
+ "eval_mean_token_accuracy": 0.8501905518215757,
+ "eval_num_tokens": 5837321.0,
+ "eval_runtime": 85.7578,
+ "eval_samples_per_second": 16.034,
+ "eval_steps_per_second": 2.006,
+ "step": 2500
+ },
+ {
+ "entropy": 0.15765639198943973,
+ "epoch": 6.268991282689913,
+ "grad_norm": 0.47331130504608154,
+ "learning_rate": 8.324066858090663e-05,
+ "loss": 0.09571113586425781,
+ "mean_token_accuracy": 0.9683481335639954,
+ "num_tokens": 5884398.0,
+ "step": 2520
+ },
+ {
+ "epoch": 6.268991282689913,
+ "eval_entropy": 0.29231513846059176,
+ "eval_loss": 0.7392512559890747,
+ "eval_mean_token_accuracy": 0.8486633983462356,
+ "eval_num_tokens": 5884398.0,
+ "eval_runtime": 85.7846,
+ "eval_samples_per_second": 16.029,
+ "eval_steps_per_second": 2.005,
+ "step": 2520
+ },
+ {
+ "entropy": 0.16176860257983208,
+ "epoch": 6.318804483188045,
+ "grad_norm": 0.6142018437385559,
+ "learning_rate": 8.135028644470992e-05,
+ "loss": 0.09486144185066223,
+ "mean_token_accuracy": 0.9682316601276397,
+ "num_tokens": 5929876.0,
+ "step": 2540
+ },
+ {
+ "epoch": 6.318804483188045,
+ "eval_entropy": 0.2851274753379267,
+ "eval_loss": 0.7520816922187805,
+ "eval_mean_token_accuracy": 0.8501113649717597,
+ "eval_num_tokens": 5929876.0,
+ "eval_runtime": 85.9425,
+ "eval_samples_per_second": 15.999,
+ "eval_steps_per_second": 2.001,
+ "step": 2540
+ },
+ {
+ "entropy": 0.15404034564271568,
+ "epoch": 6.3686176836861765,
+ "grad_norm": 0.6051287651062012,
+ "learning_rate": 7.946949157063964e-05,
+ "loss": 0.09280472993850708,
+ "mean_token_accuracy": 0.9684635892510414,
+ "num_tokens": 5978490.0,
+ "step": 2560
+ },
+ {
+ "epoch": 6.3686176836861765,
+ "eval_entropy": 0.28802703563557114,
+ "eval_loss": 0.7439162135124207,
+ "eval_mean_token_accuracy": 0.8499851770872293,
+ "eval_num_tokens": 5978490.0,
+ "eval_runtime": 86.0703,
+ "eval_samples_per_second": 15.975,
+ "eval_steps_per_second": 1.998,
+ "step": 2560
+ },
+ {
+ "entropy": 0.15343588953837753,
+ "epoch": 6.418430884184309,
+ "grad_norm": 0.4823743402957916,
+ "learning_rate": 7.759885118077701e-05,
+ "loss": 0.09000591039657593,
+ "mean_token_accuracy": 0.9699928767979145,
+ "num_tokens": 6025380.0,
+ "step": 2580
+ },
+ {
+ "epoch": 6.418430884184309,
+ "eval_entropy": 0.2795634938533916,
+ "eval_loss": 0.7647850513458252,
+ "eval_mean_token_accuracy": 0.8503464397995971,
+ "eval_num_tokens": 6025380.0,
+ "eval_runtime": 85.8886,
+ "eval_samples_per_second": 16.009,
+ "eval_steps_per_second": 2.003,
+ "step": 2580
+ },
+ {
+ "entropy": 0.15740026142448188,
+ "epoch": 6.468244084682441,
+ "grad_norm": 0.5082696676254272,
+ "learning_rate": 7.57389294347494e-05,
+ "loss": 0.09191849827766418,
+ "mean_token_accuracy": 0.9692809768021107,
+ "num_tokens": 6073349.0,
+ "step": 2600
+ },
+ {
+ "epoch": 6.468244084682441,
+ "eval_entropy": 0.2913342311458532,
+ "eval_loss": 0.7518694996833801,
+ "eval_mean_token_accuracy": 0.8483168302580367,
+ "eval_num_tokens": 6073349.0,
+ "eval_runtime": 85.5761,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.01,
+ "step": 2600
+ },
+ {
+ "entropy": 0.15922069251537324,
+ "epoch": 6.518057285180573,
+ "grad_norm": 0.3995199501514435,
+ "learning_rate": 7.389028725958736e-05,
+ "loss": 0.09584367871284485,
+ "mean_token_accuracy": 0.9685114495456218,
+ "num_tokens": 6118148.0,
+ "step": 2620
+ },
+ {
+ "epoch": 6.518057285180573,
+ "eval_entropy": 0.2863075934177221,
+ "eval_loss": 0.7539381384849548,
+ "eval_mean_token_accuracy": 0.8507507083027862,
+ "eval_num_tokens": 6118148.0,
+ "eval_runtime": 86.112,
+ "eval_samples_per_second": 15.968,
+ "eval_steps_per_second": 1.997,
+ "step": 2620
+ },
+ {
+ "entropy": 0.16197575423866512,
+ "epoch": 6.567870485678705,
+ "grad_norm": 0.534295380115509,
+ "learning_rate": 7.205348218055678e-05,
+ "loss": 0.0961170256137848,
+ "mean_token_accuracy": 0.9674530044198036,
+ "num_tokens": 6165523.0,
+ "step": 2640
+ },
+ {
+ "epoch": 6.567870485678705,
+ "eval_entropy": 0.29021967315050057,
+ "eval_loss": 0.751198947429657,
+ "eval_mean_token_accuracy": 0.8509796344956686,
+ "eval_num_tokens": 6165523.0,
+ "eval_runtime": 85.7958,
+ "eval_samples_per_second": 16.026,
+ "eval_steps_per_second": 2.005,
+ "step": 2640
+ },
+ {
+ "entropy": 0.15261746793985367,
+ "epoch": 6.617683686176837,
+ "grad_norm": 0.5391237139701843,
+ "learning_rate": 7.022906815301673e-05,
+ "loss": 0.0926026999950409,
+ "mean_token_accuracy": 0.9695659473538398,
+ "num_tokens": 6216232.0,
+ "step": 2660
+ },
+ {
+ "epoch": 6.617683686176837,
+ "eval_entropy": 0.29128045216202736,
+ "eval_loss": 0.7450292110443115,
+ "eval_mean_token_accuracy": 0.8498771443616512,
+ "eval_num_tokens": 6216232.0,
+ "eval_runtime": 86.3963,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 2660
+ },
+ {
+ "entropy": 0.16164180357009172,
+ "epoch": 6.667496886674969,
+ "grad_norm": 0.5767946243286133,
+ "learning_rate": 6.841759539535419e-05,
+ "loss": 0.09291981458663941,
+ "mean_token_accuracy": 0.9687136687338352,
+ "num_tokens": 6264807.0,
+ "step": 2680
+ },
+ {
+ "epoch": 6.667496886674969,
+ "eval_entropy": 0.2897637223088464,
+ "eval_loss": 0.7503410577774048,
+ "eval_mean_token_accuracy": 0.8503315164599308,
+ "eval_num_tokens": 6264807.0,
+ "eval_runtime": 86.0653,
+ "eval_samples_per_second": 15.976,
+ "eval_steps_per_second": 1.998,
+ "step": 2680
+ },
+ {
+ "entropy": 0.17062523355707526,
+ "epoch": 6.717310087173101,
+ "grad_norm": 0.4974168539047241,
+ "learning_rate": 6.661961022304563e-05,
+ "loss": 0.09713236689567566,
+ "mean_token_accuracy": 0.9661971725523472,
+ "num_tokens": 6308819.0,
+ "step": 2700
+ },
+ {
+ "epoch": 6.717310087173101,
+ "eval_entropy": 0.2765843396963075,
+ "eval_loss": 0.7604002356529236,
+ "eval_mean_token_accuracy": 0.8521115277395692,
+ "eval_num_tokens": 6308819.0,
+ "eval_runtime": 86.1676,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 2700
+ },
+ {
+ "entropy": 0.17544092936441302,
+ "epoch": 6.767123287671232,
+ "grad_norm": 0.5523537993431091,
+ "learning_rate": 6.483565488389582e-05,
+ "loss": 0.09709116220474243,
+ "mean_token_accuracy": 0.9650957375764847,
+ "num_tokens": 6352548.0,
+ "step": 2720
+ },
+ {
+ "epoch": 6.767123287671232,
+ "eval_entropy": 0.27939334659035814,
+ "eval_loss": 0.7534670829772949,
+ "eval_mean_token_accuracy": 0.851230604010959,
+ "eval_num_tokens": 6352548.0,
+ "eval_runtime": 86.2913,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 2720
+ },
+ {
+ "entropy": 0.15991022661328316,
+ "epoch": 6.816936488169365,
+ "grad_norm": 0.478551983833313,
+ "learning_rate": 6.306626739450311e-05,
+ "loss": 0.09564646482467651,
+ "mean_token_accuracy": 0.9679084822535515,
+ "num_tokens": 6397720.0,
+ "step": 2740
+ },
+ {
+ "epoch": 6.816936488169365,
+ "eval_entropy": 0.27878295491601146,
+ "eval_loss": 0.7519959211349487,
+ "eval_mean_token_accuracy": 0.8510654949864676,
+ "eval_num_tokens": 6397720.0,
+ "eval_runtime": 85.9109,
+ "eval_samples_per_second": 16.005,
+ "eval_steps_per_second": 2.002,
+ "step": 2740
+ },
+ {
+ "entropy": 0.16824879590421915,
+ "epoch": 6.866749688667497,
+ "grad_norm": 0.6681098937988281,
+ "learning_rate": 6.131198137800108e-05,
+ "loss": 0.0962279736995697,
+ "mean_token_accuracy": 0.966830012947321,
+ "num_tokens": 6442821.0,
+ "step": 2760
+ },
+ {
+ "epoch": 6.866749688667497,
+ "eval_entropy": 0.2834690434121808,
+ "eval_loss": 0.751922070980072,
+ "eval_mean_token_accuracy": 0.8521237577809844,
+ "eval_num_tokens": 6442821.0,
+ "eval_runtime": 86.3618,
+ "eval_samples_per_second": 15.921,
+ "eval_steps_per_second": 1.992,
+ "step": 2760
+ },
+ {
+ "entropy": 0.1518704930320382,
+ "epoch": 6.916562889165629,
+ "grad_norm": 0.5201290249824524,
+ "learning_rate": 5.957332590312513e-05,
+ "loss": 0.09010660648345947,
+ "mean_token_accuracy": 0.9693463340401649,
+ "num_tokens": 6494118.0,
+ "step": 2780
+ },
+ {
+ "epoch": 6.916562889165629,
+ "eval_entropy": 0.28485129617674404,
+ "eval_loss": 0.7452457547187805,
+ "eval_mean_token_accuracy": 0.8512036796919135,
+ "eval_num_tokens": 6494118.0,
+ "eval_runtime": 86.4524,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2780
+ },
+ {
+ "entropy": 0.15512610590085388,
+ "epoch": 6.966376089663761,
+ "grad_norm": 0.42802050709724426,
+ "learning_rate": 5.785082532465233e-05,
+ "loss": 0.09320432543754578,
+ "mean_token_accuracy": 0.9686134628951549,
+ "num_tokens": 6540175.0,
+ "step": 2800
+ },
+ {
+ "epoch": 6.966376089663761,
+ "eval_entropy": 0.27554594526110693,
+ "eval_loss": 0.7644653916358948,
+ "eval_mean_token_accuracy": 0.8513738523389018,
+ "eval_num_tokens": 6540175.0,
+ "eval_runtime": 85.7609,
+ "eval_samples_per_second": 16.033,
+ "eval_steps_per_second": 2.006,
+ "step": 2800
+ },
+ {
+ "entropy": 0.17524497526196334,
+ "epoch": 7.01494396014944,
+ "grad_norm": 0.3330269157886505,
+ "learning_rate": 5.6144999125263545e-05,
+ "loss": 0.0895616888999939,
+ "mean_token_accuracy": 0.9682766932707566,
+ "num_tokens": 6583767.0,
+ "step": 2820
+ },
+ {
+ "epoch": 7.01494396014944,
+ "eval_entropy": 0.2735865569218647,
+ "eval_loss": 0.768479585647583,
+ "eval_mean_token_accuracy": 0.8503459383581959,
+ "eval_num_tokens": 6583767.0,
+ "eval_runtime": 85.7162,
+ "eval_samples_per_second": 16.041,
+ "eval_steps_per_second": 2.007,
+ "step": 2820
+ },
+ {
+ "entropy": 0.1403565663844347,
+ "epoch": 7.064757160647572,
+ "grad_norm": 0.35613498091697693,
+ "learning_rate": 5.4456361758874235e-05,
+ "loss": 0.07551313638687134,
+ "mean_token_accuracy": 0.9739301167428493,
+ "num_tokens": 6627672.0,
+ "step": 2840
+ },
+ {
+ "epoch": 7.064757160647572,
+ "eval_entropy": 0.25941789089593775,
+ "eval_loss": 0.8209511637687683,
+ "eval_mean_token_accuracy": 0.8505055855873019,
+ "eval_num_tokens": 6627672.0,
+ "eval_runtime": 86.0943,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 2840
+ },
+ {
+ "entropy": 0.13500106502324344,
+ "epoch": 7.114570361145703,
+ "grad_norm": 0.34418627619743347,
+ "learning_rate": 5.2785422495482234e-05,
+ "loss": 0.07293946146965027,
+ "mean_token_accuracy": 0.9747208289802074,
+ "num_tokens": 6672946.0,
+ "step": 2860
+ },
+ {
+ "epoch": 7.114570361145703,
+ "eval_entropy": 0.26482899772912954,
+ "eval_loss": 0.798904538154602,
+ "eval_mean_token_accuracy": 0.8511530233677044,
+ "eval_num_tokens": 6672946.0,
+ "eval_runtime": 85.7915,
+ "eval_samples_per_second": 16.027,
+ "eval_steps_per_second": 2.005,
+ "step": 2860
+ },
+ {
+ "entropy": 0.13127502552233636,
+ "epoch": 7.164383561643835,
+ "grad_norm": 0.4638441503047943,
+ "learning_rate": 5.113268526757892e-05,
+ "loss": 0.07121461629867554,
+ "mean_token_accuracy": 0.9756786689162255,
+ "num_tokens": 6718582.0,
+ "step": 2880
+ },
+ {
+ "epoch": 7.164383561643835,
+ "eval_entropy": 0.2645381211714689,
+ "eval_loss": 0.809101939201355,
+ "eval_mean_token_accuracy": 0.8514727898115335,
+ "eval_num_tokens": 6718582.0,
+ "eval_runtime": 85.84,
+ "eval_samples_per_second": 16.018,
+ "eval_steps_per_second": 2.004,
+ "step": 2880
+ },
+ {
+ "entropy": 0.1331390908919275,
+ "epoch": 7.214196762141968,
+ "grad_norm": 0.40206775069236755,
+ "learning_rate": 4.949864851817007e-05,
+ "loss": 0.07188264131546021,
+ "mean_token_accuracy": 0.9755406074225903,
+ "num_tokens": 6764387.0,
+ "step": 2900
+ },
+ {
+ "epoch": 7.214196762141968,
+ "eval_entropy": 0.26244733283339544,
+ "eval_loss": 0.8143188953399658,
+ "eval_mean_token_accuracy": 0.8514358189909957,
+ "eval_num_tokens": 6764387.0,
+ "eval_runtime": 85.8546,
+ "eval_samples_per_second": 16.015,
+ "eval_steps_per_second": 2.003,
+ "step": 2900
+ },
+ {
+ "entropy": 0.13647331558167936,
+ "epoch": 7.2640099626401,
+ "grad_norm": 0.26405787467956543,
+ "learning_rate": 4.788380505045224e-05,
+ "loss": 0.07412450313568116,
+ "mean_token_accuracy": 0.9744274213910102,
+ "num_tokens": 6809678.0,
+ "step": 2920
+ },
+ {
+ "epoch": 7.2640099626401,
+ "eval_entropy": 0.2626111418182074,
+ "eval_loss": 0.8111525177955627,
+ "eval_mean_token_accuracy": 0.8512121695418691,
+ "eval_num_tokens": 6809678.0,
+ "eval_runtime": 85.9626,
+ "eval_samples_per_second": 15.995,
+ "eval_steps_per_second": 2.001,
+ "step": 2920
+ },
+ {
+ "entropy": 0.12644002586603165,
+ "epoch": 7.313823163138232,
+ "grad_norm": 0.27514681220054626,
+ "learning_rate": 4.6288641879189884e-05,
+ "loss": 0.06807711124420165,
+ "mean_token_accuracy": 0.9760703906416893,
+ "num_tokens": 6860750.0,
+ "step": 2940
+ },
+ {
+ "epoch": 7.313823163138232,
+ "eval_entropy": 0.26096762734097106,
+ "eval_loss": 0.8184595108032227,
+ "eval_mean_token_accuracy": 0.8501476153384807,
+ "eval_num_tokens": 6860750.0,
+ "eval_runtime": 85.9521,
+ "eval_samples_per_second": 15.997,
+ "eval_steps_per_second": 2.001,
+ "step": 2940
+ },
+ {
+ "entropy": 0.13920630998909472,
+ "epoch": 7.363636363636363,
+ "grad_norm": 0.23584705591201782,
+ "learning_rate": 4.4713640083838604e-05,
+ "loss": 0.07301607131958007,
+ "mean_token_accuracy": 0.9745715200901032,
+ "num_tokens": 6907092.0,
+ "step": 2960
+ },
+ {
+ "epoch": 7.363636363636363,
+ "eval_entropy": 0.2612536767021168,
+ "eval_loss": 0.8116245269775391,
+ "eval_mean_token_accuracy": 0.8510967350976412,
+ "eval_num_tokens": 6907092.0,
+ "eval_runtime": 85.6373,
+ "eval_samples_per_second": 16.056,
+ "eval_steps_per_second": 2.008,
+ "step": 2960
+ },
+ {
+ "entropy": 0.1349492883309722,
+ "epoch": 7.4134495641344955,
+ "grad_norm": 0.24552719295024872,
+ "learning_rate": 4.315927466345791e-05,
+ "loss": 0.07397544980049134,
+ "mean_token_accuracy": 0.9745095103979111,
+ "num_tokens": 6952700.0,
+ "step": 2980
+ },
+ {
+ "epoch": 7.4134495641344955,
+ "eval_entropy": 0.25796533306670744,
+ "eval_loss": 0.8266491293907166,
+ "eval_mean_token_accuracy": 0.8511653857868772,
+ "eval_num_tokens": 6952700.0,
+ "eval_runtime": 85.7462,
+ "eval_samples_per_second": 16.036,
+ "eval_steps_per_second": 2.006,
+ "step": 2980
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.930963916112097e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-300/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-300/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-300/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-300/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-300/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-300/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-300/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-300/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-300/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-300/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-300/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-300/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-300/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-300/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..df9c7d8c4425878ab57df1d83065083cea3ff2e3
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-300/trainer_state.json
@@ -0,0 +1,349 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 0.7471980074719801,
+ "eval_steps": 20,
+ "global_step": 300,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.9940793533825024e+16,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3000/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3000/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3000/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3000/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3000/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3000/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3000/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3000/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3000/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3000/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3000/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3000/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3000/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3000/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..13e798bdf7d792678026df544219ab4545df5542
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3000/trainer_state.json
@@ -0,0 +1,3184 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 7.463262764632628,
+ "eval_steps": 20,
+ "global_step": 3000,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ },
+ {
+ "entropy": 0.3193941755220294,
+ "epoch": 4.5280199252802,
+ "grad_norm": 0.8281906843185425,
+ "learning_rate": 0.0001509111761786888,
+ "loss": 0.23936262130737304,
+ "mean_token_accuracy": 0.9201708927750587,
+ "num_tokens": 4244423.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.5280199252802,
+ "eval_entropy": 0.38704028864239537,
+ "eval_loss": 0.6006569266319275,
+ "eval_mean_token_accuracy": 0.8502406720505205,
+ "eval_num_tokens": 4244423.0,
+ "eval_runtime": 86.8059,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1820
+ },
+ {
+ "entropy": 0.3164879363030195,
+ "epoch": 4.577833125778331,
+ "grad_norm": 0.7892968654632568,
+ "learning_rate": 0.00014905346557909867,
+ "loss": 0.24541733264923096,
+ "mean_token_accuracy": 0.9175932116806507,
+ "num_tokens": 4289773.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.577833125778331,
+ "eval_entropy": 0.38861122120951497,
+ "eval_loss": 0.6115967631340027,
+ "eval_mean_token_accuracy": 0.849471275196519,
+ "eval_num_tokens": 4289773.0,
+ "eval_runtime": 86.2946,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1840
+ },
+ {
+ "entropy": 0.3051785985007882,
+ "epoch": 4.627646326276463,
+ "grad_norm": 0.8109654188156128,
+ "learning_rate": 0.0001471849238862319,
+ "loss": 0.23433220386505127,
+ "mean_token_accuracy": 0.9206570319831371,
+ "num_tokens": 4336894.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.627646326276463,
+ "eval_entropy": 0.37162452295076015,
+ "eval_loss": 0.6184061765670776,
+ "eval_mean_token_accuracy": 0.8501173268223918,
+ "eval_num_tokens": 4336894.0,
+ "eval_runtime": 86.6865,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1860
+ },
+ {
+ "entropy": 0.3168198253959417,
+ "epoch": 4.677459526774595,
+ "grad_norm": 0.9512342214584351,
+ "learning_rate": 0.0001453061146267775,
+ "loss": 0.23832404613494873,
+ "mean_token_accuracy": 0.9197044663131237,
+ "num_tokens": 4382947.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.677459526774595,
+ "eval_entropy": 0.3845940856912801,
+ "eval_loss": 0.606762707233429,
+ "eval_mean_token_accuracy": 0.8504838194957999,
+ "eval_num_tokens": 4382947.0,
+ "eval_runtime": 86.5175,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 1880
+ },
+ {
+ "entropy": 0.30791807882487776,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 0.8123113512992859,
+ "learning_rate": 0.00014341760442398248,
+ "loss": 0.2395785331726074,
+ "mean_token_accuracy": 0.918928150832653,
+ "num_tokens": 4433050.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.7272727272727275,
+ "eval_entropy": 0.39762327222283494,
+ "eval_loss": 0.5994202494621277,
+ "eval_mean_token_accuracy": 0.8509274201337681,
+ "eval_num_tokens": 4433050.0,
+ "eval_runtime": 86.2873,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.993,
+ "step": 1900
+ },
+ {
+ "entropy": 0.3021434534341097,
+ "epoch": 4.777085927770859,
+ "grad_norm": 0.731787383556366,
+ "learning_rate": 0.000141519962826766,
+ "loss": 0.23494718074798585,
+ "mean_token_accuracy": 0.9201403826475143,
+ "num_tokens": 4483598.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.777085927770859,
+ "eval_entropy": 0.3827026732439219,
+ "eval_loss": 0.5995895862579346,
+ "eval_mean_token_accuracy": 0.851468373523202,
+ "eval_num_tokens": 4483598.0,
+ "eval_runtime": 86.3006,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 1920
+ },
+ {
+ "entropy": 0.31626159623265265,
+ "epoch": 4.826899128268991,
+ "grad_norm": 0.8848487138748169,
+ "learning_rate": 0.00013961376213795132,
+ "loss": 0.2439030647277832,
+ "mean_token_accuracy": 0.9196575872600079,
+ "num_tokens": 4529201.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.826899128268991,
+ "eval_entropy": 0.388698436839636,
+ "eval_loss": 0.6000174283981323,
+ "eval_mean_token_accuracy": 0.8518068187458571,
+ "eval_num_tokens": 4529201.0,
+ "eval_runtime": 86.8979,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.979,
+ "step": 1940
+ },
+ {
+ "entropy": 0.30520407035946845,
+ "epoch": 4.876712328767123,
+ "grad_norm": 0.8532460927963257,
+ "learning_rate": 0.00013769957724166695,
+ "loss": 0.23458616733551024,
+ "mean_token_accuracy": 0.9221912942826748,
+ "num_tokens": 4578167.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.876712328767123,
+ "eval_entropy": 0.38777847102908203,
+ "eval_loss": 0.6004981398582458,
+ "eval_mean_token_accuracy": 0.8516481768253238,
+ "eval_num_tokens": 4578167.0,
+ "eval_runtime": 87.0777,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.975,
+ "step": 1960
+ },
+ {
+ "entropy": 0.3226448342204094,
+ "epoch": 4.926525529265255,
+ "grad_norm": 0.6945561766624451,
+ "learning_rate": 0.0001357779854299694,
+ "loss": 0.24048397541046143,
+ "mean_token_accuracy": 0.9195300146937371,
+ "num_tokens": 4622316.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.926525529265255,
+ "eval_entropy": 0.38581624263247777,
+ "eval_loss": 0.6029234528541565,
+ "eval_mean_token_accuracy": 0.8514213260523108,
+ "eval_num_tokens": 4622316.0,
+ "eval_runtime": 85.8729,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 1980
+ },
+ {
+ "entropy": 0.3051655298098922,
+ "epoch": 4.976338729763388,
+ "grad_norm": 0.7976452708244324,
+ "learning_rate": 0.00013384956622874001,
+ "loss": 0.23584742546081544,
+ "mean_token_accuracy": 0.9216851457953453,
+ "num_tokens": 4670746.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.976338729763388,
+ "eval_entropy": 0.37913159246361533,
+ "eval_loss": 0.6057604551315308,
+ "eval_mean_token_accuracy": 0.8525801203971686,
+ "eval_num_tokens": 4670746.0,
+ "eval_runtime": 86.1145,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2000
+ },
+ {
+ "entropy": 0.27438195240803254,
+ "epoch": 5.024906600249066,
+ "grad_norm": 0.6729586124420166,
+ "learning_rate": 0.0001319149012229075,
+ "loss": 0.19775952100753785,
+ "mean_token_accuracy": 0.9339428559327737,
+ "num_tokens": 4716176.0,
+ "step": 2020
+ },
+ {
+ "epoch": 5.024906600249066,
+ "eval_entropy": 0.3448961910813354,
+ "eval_loss": 0.6750120520591736,
+ "eval_mean_token_accuracy": 0.8487970232963562,
+ "eval_num_tokens": 4716176.0,
+ "eval_runtime": 86.1169,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2020
+ },
+ {
+ "entropy": 0.21423916313797237,
+ "epoch": 5.074719800747198,
+ "grad_norm": 0.6934391856193542,
+ "learning_rate": 0.00012997457388105022,
+ "loss": 0.1439570426940918,
+ "mean_token_accuracy": 0.9528236843645572,
+ "num_tokens": 4763269.0,
+ "step": 2040
+ },
+ {
+ "epoch": 5.074719800747198,
+ "eval_entropy": 0.3570949243771475,
+ "eval_loss": 0.6465504169464111,
+ "eval_mean_token_accuracy": 0.8490785547467166,
+ "eval_num_tokens": 4763269.0,
+ "eval_runtime": 85.9574,
+ "eval_samples_per_second": 15.996,
+ "eval_steps_per_second": 2.001,
+ "step": 2040
+ },
+ {
+ "entropy": 0.20838565267622472,
+ "epoch": 5.12453300124533,
+ "grad_norm": 0.7286986112594604,
+ "learning_rate": 0.00012802916937942972,
+ "loss": 0.14467307329177856,
+ "mean_token_accuracy": 0.950994835793972,
+ "num_tokens": 4809047.0,
+ "step": 2060
+ },
+ {
+ "epoch": 5.12453300124533,
+ "eval_entropy": 0.3452463157821533,
+ "eval_loss": 0.6705958843231201,
+ "eval_mean_token_accuracy": 0.8490352796953778,
+ "eval_num_tokens": 4809047.0,
+ "eval_runtime": 86.228,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 2060
+ },
+ {
+ "entropy": 0.20453082229942082,
+ "epoch": 5.174346201743462,
+ "grad_norm": 0.7515555620193481,
+ "learning_rate": 0.00012607927442550974,
+ "loss": 0.13732000589370727,
+ "mean_token_accuracy": 0.9537357829511166,
+ "num_tokens": 4857965.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.174346201743462,
+ "eval_entropy": 0.32431264914745506,
+ "eval_loss": 0.6743043065071106,
+ "eval_mean_token_accuracy": 0.8504878629085629,
+ "eval_num_tokens": 4857965.0,
+ "eval_runtime": 86.5948,
+ "eval_samples_per_second": 15.879,
+ "eval_steps_per_second": 1.986,
+ "step": 2080
+ },
+ {
+ "entropy": 0.21812320686876774,
+ "epoch": 5.224159402241594,
+ "grad_norm": 0.9093465209007263,
+ "learning_rate": 0.0001241254770810132,
+ "loss": 0.14311420917510986,
+ "mean_token_accuracy": 0.9514068141579628,
+ "num_tokens": 4905151.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.224159402241594,
+ "eval_entropy": 0.33086285835435225,
+ "eval_loss": 0.6676449179649353,
+ "eval_mean_token_accuracy": 0.8505287662495015,
+ "eval_num_tokens": 4905151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 2100
+ },
+ {
+ "entropy": 0.2180163251236081,
+ "epoch": 5.273972602739726,
+ "grad_norm": 0.6703007221221924,
+ "learning_rate": 0.00012216836658457075,
+ "loss": 0.14803968667984008,
+ "mean_token_accuracy": 0.9521303348243236,
+ "num_tokens": 4947072.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.273972602739726,
+ "eval_entropy": 0.33162341708707255,
+ "eval_loss": 0.6658875942230225,
+ "eval_mean_token_accuracy": 0.8500757605530495,
+ "eval_num_tokens": 4947072.0,
+ "eval_runtime": 86.6296,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 2120
+ },
+ {
+ "entropy": 0.22511130161583423,
+ "epoch": 5.323785803237858,
+ "grad_norm": 0.8078880906105042,
+ "learning_rate": 0.00012020853317401455,
+ "loss": 0.15228408575057983,
+ "mean_token_accuracy": 0.947144789993763,
+ "num_tokens": 4991974.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.323785803237858,
+ "eval_entropy": 0.3354601170434508,
+ "eval_loss": 0.6677829623222351,
+ "eval_mean_token_accuracy": 0.8482600024273229,
+ "eval_num_tokens": 4991974.0,
+ "eval_runtime": 86.4689,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.989,
+ "step": 2140
+ },
+ {
+ "entropy": 0.2244176059961319,
+ "epoch": 5.37359900373599,
+ "grad_norm": 0.9636075496673584,
+ "learning_rate": 0.00011824656790837037,
+ "loss": 0.15260883569717407,
+ "mean_token_accuracy": 0.9471467643976211,
+ "num_tokens": 5038400.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.37359900373599,
+ "eval_entropy": 0.3381616926297199,
+ "eval_loss": 0.6694412231445312,
+ "eval_mean_token_accuracy": 0.8482369603805764,
+ "eval_num_tokens": 5038400.0,
+ "eval_runtime": 86.4147,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 2160
+ },
+ {
+ "entropy": 0.22982364390045404,
+ "epoch": 5.423412204234122,
+ "grad_norm": 0.775401771068573,
+ "learning_rate": 0.00011628306248960262,
+ "loss": 0.15140302181243898,
+ "mean_token_accuracy": 0.9492553934454918,
+ "num_tokens": 5083166.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.423412204234122,
+ "eval_entropy": 0.3305150235808173,
+ "eval_loss": 0.6717822551727295,
+ "eval_mean_token_accuracy": 0.8489849723355715,
+ "eval_num_tokens": 5083166.0,
+ "eval_runtime": 86.4728,
+ "eval_samples_per_second": 15.901,
+ "eval_steps_per_second": 1.989,
+ "step": 2180
+ },
+ {
+ "entropy": 0.21448935717344284,
+ "epoch": 5.473225404732254,
+ "grad_norm": 0.6575281023979187,
+ "learning_rate": 0.00011431860908416465,
+ "loss": 0.1452319622039795,
+ "mean_token_accuracy": 0.9505287684500218,
+ "num_tokens": 5135109.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.473225404732254,
+ "eval_entropy": 0.3488145174328671,
+ "eval_loss": 0.6612305641174316,
+ "eval_mean_token_accuracy": 0.8492907808963642,
+ "eval_num_tokens": 5135109.0,
+ "eval_runtime": 86.6927,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 2200
+ },
+ {
+ "entropy": 0.23091202937066554,
+ "epoch": 5.523038605230386,
+ "grad_norm": 0.8909686207771301,
+ "learning_rate": 0.00011235380014440985,
+ "loss": 0.15150139331817628,
+ "mean_token_accuracy": 0.9497875183820724,
+ "num_tokens": 5180138.0,
+ "step": 2220
+ },
+ {
+ "epoch": 5.523038605230386,
+ "eval_entropy": 0.3268539015810157,
+ "eval_loss": 0.6667542457580566,
+ "eval_mean_token_accuracy": 0.8499062903398691,
+ "eval_num_tokens": 5180138.0,
+ "eval_runtime": 86.4644,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 2220
+ },
+ {
+ "entropy": 0.2227974807843566,
+ "epoch": 5.572851805728518,
+ "grad_norm": 0.6180275082588196,
+ "learning_rate": 0.0001103892282299158,
+ "loss": 0.1491069197654724,
+ "mean_token_accuracy": 0.9488144010305405,
+ "num_tokens": 5226864.0,
+ "step": 2240
+ },
+ {
+ "epoch": 5.572851805728518,
+ "eval_entropy": 0.3346347655494546,
+ "eval_loss": 0.6665948629379272,
+ "eval_mean_token_accuracy": 0.8499961893918903,
+ "eval_num_tokens": 5226864.0,
+ "eval_runtime": 87.0548,
+ "eval_samples_per_second": 15.795,
+ "eval_steps_per_second": 1.976,
+ "step": 2240
+ },
+ {
+ "entropy": 0.21368421968072654,
+ "epoch": 5.62266500622665,
+ "grad_norm": 0.6004369258880615,
+ "learning_rate": 0.00010842548582877651,
+ "loss": 0.14485255479812623,
+ "mean_token_accuracy": 0.9502056457102299,
+ "num_tokens": 5276602.0,
+ "step": 2260
+ },
+ {
+ "epoch": 5.62266500622665,
+ "eval_entropy": 0.32753298804163933,
+ "eval_loss": 0.6680151224136353,
+ "eval_mean_token_accuracy": 0.8515451086121936,
+ "eval_num_tokens": 5276602.0,
+ "eval_runtime": 86.8524,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.98,
+ "step": 2260
+ },
+ {
+ "entropy": 0.2103635374456644,
+ "epoch": 5.672478206724782,
+ "grad_norm": 0.699174702167511,
+ "learning_rate": 0.00010646316517891613,
+ "loss": 0.14297772645950318,
+ "mean_token_accuracy": 0.9512537539005279,
+ "num_tokens": 5323718.0,
+ "step": 2280
+ },
+ {
+ "epoch": 5.672478206724782,
+ "eval_entropy": 0.32966585959806,
+ "eval_loss": 0.675578773021698,
+ "eval_mean_token_accuracy": 0.8509623023659684,
+ "eval_num_tokens": 5323718.0,
+ "eval_runtime": 86.4518,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2280
+ },
+ {
+ "entropy": 0.22516900151968003,
+ "epoch": 5.722291407222914,
+ "grad_norm": 0.6637354493141174,
+ "learning_rate": 0.00010450285808947797,
+ "loss": 0.15202572345733642,
+ "mean_token_accuracy": 0.9482452072203159,
+ "num_tokens": 5369039.0,
+ "step": 2300
+ },
+ {
+ "epoch": 5.722291407222914,
+ "eval_entropy": 0.3369456917740578,
+ "eval_loss": 0.6697061061859131,
+ "eval_mean_token_accuracy": 0.848603522361711,
+ "eval_num_tokens": 5369039.0,
+ "eval_runtime": 86.6371,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.985,
+ "step": 2300
+ },
+ {
+ "entropy": 0.21841065725311637,
+ "epoch": 5.772104607721046,
+ "grad_norm": 0.7940268516540527,
+ "learning_rate": 0.00010254515576234297,
+ "loss": 0.14710167646408082,
+ "mean_token_accuracy": 0.9493498183786869,
+ "num_tokens": 5417029.0,
+ "step": 2320
+ },
+ {
+ "epoch": 5.772104607721046,
+ "eval_entropy": 0.3237486180177955,
+ "eval_loss": 0.6779657602310181,
+ "eval_mean_token_accuracy": 0.8500715313955794,
+ "eval_num_tokens": 5417029.0,
+ "eval_runtime": 86.1826,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 1.996,
+ "step": 2320
+ },
+ {
+ "entropy": 0.22146204356104135,
+ "epoch": 5.821917808219178,
+ "grad_norm": 0.9234833121299744,
+ "learning_rate": 0.00010059064861383132,
+ "loss": 0.14720046520233154,
+ "mean_token_accuracy": 0.9493872679769992,
+ "num_tokens": 5461671.0,
+ "step": 2340
+ },
+ {
+ "epoch": 5.821917808219178,
+ "eval_entropy": 0.32365207564692167,
+ "eval_loss": 0.6704005002975464,
+ "eval_mean_token_accuracy": 0.8507985760306203,
+ "eval_num_tokens": 5461671.0,
+ "eval_runtime": 86.5494,
+ "eval_samples_per_second": 15.887,
+ "eval_steps_per_second": 1.987,
+ "step": 2340
+ },
+ {
+ "entropy": 0.20934011954814197,
+ "epoch": 5.87173100871731,
+ "grad_norm": 0.5547503232955933,
+ "learning_rate": 9.863992609664084e-05,
+ "loss": 0.1464867353439331,
+ "mean_token_accuracy": 0.9503875687718392,
+ "num_tokens": 5509312.0,
+ "step": 2360
+ },
+ {
+ "epoch": 5.87173100871731,
+ "eval_entropy": 0.3330401429083458,
+ "eval_loss": 0.6659091114997864,
+ "eval_mean_token_accuracy": 0.8504848906467127,
+ "eval_num_tokens": 5509312.0,
+ "eval_runtime": 86.5855,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 2360
+ },
+ {
+ "entropy": 0.21678635366261007,
+ "epoch": 5.921544209215442,
+ "grad_norm": 0.570612907409668,
+ "learning_rate": 9.669357652207635e-05,
+ "loss": 0.14821385145187377,
+ "mean_token_accuracy": 0.9503940217196941,
+ "num_tokens": 5558196.0,
+ "step": 2380
+ },
+ {
+ "epoch": 5.921544209215442,
+ "eval_entropy": 0.3322022325077722,
+ "eval_loss": 0.6722489595413208,
+ "eval_mean_token_accuracy": 0.8489979422369669,
+ "eval_num_tokens": 5558196.0,
+ "eval_runtime": 86.2986,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 2380
+ },
+ {
+ "entropy": 0.20932920072227718,
+ "epoch": 5.971357409713574,
+ "grad_norm": 0.7879557609558105,
+ "learning_rate": 9.475218688262262e-05,
+ "loss": 0.14675841331481934,
+ "mean_token_accuracy": 0.9507176131010056,
+ "num_tokens": 5605400.0,
+ "step": 2400
+ },
+ {
+ "epoch": 5.971357409713574,
+ "eval_entropy": 0.3199348642902319,
+ "eval_loss": 0.6698136329650879,
+ "eval_mean_token_accuracy": 0.8514142130003419,
+ "eval_num_tokens": 5605400.0,
+ "eval_runtime": 85.8995,
+ "eval_samples_per_second": 16.007,
+ "eval_steps_per_second": 2.002,
+ "step": 2400
+ },
+ {
+ "entropy": 0.21032143919131693,
+ "epoch": 6.019925280199253,
+ "grad_norm": 0.5823076367378235,
+ "learning_rate": 9.281634267491569e-05,
+ "loss": 0.13322267532348633,
+ "mean_token_accuracy": 0.9550939072401096,
+ "num_tokens": 5648968.0,
+ "step": 2420
+ },
+ {
+ "epoch": 6.019925280199253,
+ "eval_entropy": 0.30206270117399303,
+ "eval_loss": 0.7093168497085571,
+ "eval_mean_token_accuracy": 0.8500627639681794,
+ "eval_num_tokens": 5648968.0,
+ "eval_runtime": 85.8128,
+ "eval_samples_per_second": 16.023,
+ "eval_steps_per_second": 2.004,
+ "step": 2420
+ },
+ {
+ "entropy": 0.1534628233872354,
+ "epoch": 6.069738480697385,
+ "grad_norm": 0.710133969783783,
+ "learning_rate": 9.088662772316508e-05,
+ "loss": 0.09078952670097351,
+ "mean_token_accuracy": 0.9678447999060154,
+ "num_tokens": 5697633.0,
+ "step": 2440
+ },
+ {
+ "epoch": 6.069738480697385,
+ "eval_entropy": 0.28208133101809857,
+ "eval_loss": 0.7636417150497437,
+ "eval_mean_token_accuracy": 0.8494061477655588,
+ "eval_num_tokens": 5697633.0,
+ "eval_runtime": 85.9724,
+ "eval_samples_per_second": 15.994,
+ "eval_steps_per_second": 2.001,
+ "step": 2440
+ },
+ {
+ "entropy": 0.16151462448760867,
+ "epoch": 6.119551681195516,
+ "grad_norm": 0.5793812274932861,
+ "learning_rate": 8.896362400308028e-05,
+ "loss": 0.09545697569847107,
+ "mean_token_accuracy": 0.9671573750674725,
+ "num_tokens": 5745090.0,
+ "step": 2460
+ },
+ {
+ "epoch": 6.119551681195516,
+ "eval_entropy": 0.2833245605403601,
+ "eval_loss": 0.7402405738830566,
+ "eval_mean_token_accuracy": 0.8503523728875226,
+ "eval_num_tokens": 5745090.0,
+ "eval_runtime": 85.5461,
+ "eval_samples_per_second": 16.073,
+ "eval_steps_per_second": 2.011,
+ "step": 2460
+ },
+ {
+ "entropy": 0.15203177919611335,
+ "epoch": 6.169364881693649,
+ "grad_norm": 0.4251123368740082,
+ "learning_rate": 8.704791146635483e-05,
+ "loss": 0.09420782327651978,
+ "mean_token_accuracy": 0.9677386932075024,
+ "num_tokens": 5790333.0,
+ "step": 2480
+ },
+ {
+ "epoch": 6.169364881693649,
+ "eval_entropy": 0.28572545962971313,
+ "eval_loss": 0.735416829586029,
+ "eval_mean_token_accuracy": 0.8487084663884584,
+ "eval_num_tokens": 5790333.0,
+ "eval_runtime": 85.4801,
+ "eval_samples_per_second": 16.086,
+ "eval_steps_per_second": 2.012,
+ "step": 2480
+ },
+ {
+ "entropy": 0.15587336672469973,
+ "epoch": 6.219178082191781,
+ "grad_norm": 0.4357028007507324,
+ "learning_rate": 8.514006786576085e-05,
+ "loss": 0.09429320096969604,
+ "mean_token_accuracy": 0.9682952925562859,
+ "num_tokens": 5837321.0,
+ "step": 2500
+ },
+ {
+ "epoch": 6.219178082191781,
+ "eval_entropy": 0.2859006894882335,
+ "eval_loss": 0.7347224950790405,
+ "eval_mean_token_accuracy": 0.8501905518215757,
+ "eval_num_tokens": 5837321.0,
+ "eval_runtime": 85.7578,
+ "eval_samples_per_second": 16.034,
+ "eval_steps_per_second": 2.006,
+ "step": 2500
+ },
+ {
+ "entropy": 0.15765639198943973,
+ "epoch": 6.268991282689913,
+ "grad_norm": 0.47331130504608154,
+ "learning_rate": 8.324066858090663e-05,
+ "loss": 0.09571113586425781,
+ "mean_token_accuracy": 0.9683481335639954,
+ "num_tokens": 5884398.0,
+ "step": 2520
+ },
+ {
+ "epoch": 6.268991282689913,
+ "eval_entropy": 0.29231513846059176,
+ "eval_loss": 0.7392512559890747,
+ "eval_mean_token_accuracy": 0.8486633983462356,
+ "eval_num_tokens": 5884398.0,
+ "eval_runtime": 85.7846,
+ "eval_samples_per_second": 16.029,
+ "eval_steps_per_second": 2.005,
+ "step": 2520
+ },
+ {
+ "entropy": 0.16176860257983208,
+ "epoch": 6.318804483188045,
+ "grad_norm": 0.6142018437385559,
+ "learning_rate": 8.135028644470992e-05,
+ "loss": 0.09486144185066223,
+ "mean_token_accuracy": 0.9682316601276397,
+ "num_tokens": 5929876.0,
+ "step": 2540
+ },
+ {
+ "epoch": 6.318804483188045,
+ "eval_entropy": 0.2851274753379267,
+ "eval_loss": 0.7520816922187805,
+ "eval_mean_token_accuracy": 0.8501113649717597,
+ "eval_num_tokens": 5929876.0,
+ "eval_runtime": 85.9425,
+ "eval_samples_per_second": 15.999,
+ "eval_steps_per_second": 2.001,
+ "step": 2540
+ },
+ {
+ "entropy": 0.15404034564271568,
+ "epoch": 6.3686176836861765,
+ "grad_norm": 0.6051287651062012,
+ "learning_rate": 7.946949157063964e-05,
+ "loss": 0.09280472993850708,
+ "mean_token_accuracy": 0.9684635892510414,
+ "num_tokens": 5978490.0,
+ "step": 2560
+ },
+ {
+ "epoch": 6.3686176836861765,
+ "eval_entropy": 0.28802703563557114,
+ "eval_loss": 0.7439162135124207,
+ "eval_mean_token_accuracy": 0.8499851770872293,
+ "eval_num_tokens": 5978490.0,
+ "eval_runtime": 86.0703,
+ "eval_samples_per_second": 15.975,
+ "eval_steps_per_second": 1.998,
+ "step": 2560
+ },
+ {
+ "entropy": 0.15343588953837753,
+ "epoch": 6.418430884184309,
+ "grad_norm": 0.4823743402957916,
+ "learning_rate": 7.759885118077701e-05,
+ "loss": 0.09000591039657593,
+ "mean_token_accuracy": 0.9699928767979145,
+ "num_tokens": 6025380.0,
+ "step": 2580
+ },
+ {
+ "epoch": 6.418430884184309,
+ "eval_entropy": 0.2795634938533916,
+ "eval_loss": 0.7647850513458252,
+ "eval_mean_token_accuracy": 0.8503464397995971,
+ "eval_num_tokens": 6025380.0,
+ "eval_runtime": 85.8886,
+ "eval_samples_per_second": 16.009,
+ "eval_steps_per_second": 2.003,
+ "step": 2580
+ },
+ {
+ "entropy": 0.15740026142448188,
+ "epoch": 6.468244084682441,
+ "grad_norm": 0.5082696676254272,
+ "learning_rate": 7.57389294347494e-05,
+ "loss": 0.09191849827766418,
+ "mean_token_accuracy": 0.9692809768021107,
+ "num_tokens": 6073349.0,
+ "step": 2600
+ },
+ {
+ "epoch": 6.468244084682441,
+ "eval_entropy": 0.2913342311458532,
+ "eval_loss": 0.7518694996833801,
+ "eval_mean_token_accuracy": 0.8483168302580367,
+ "eval_num_tokens": 6073349.0,
+ "eval_runtime": 85.5761,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.01,
+ "step": 2600
+ },
+ {
+ "entropy": 0.15922069251537324,
+ "epoch": 6.518057285180573,
+ "grad_norm": 0.3995199501514435,
+ "learning_rate": 7.389028725958736e-05,
+ "loss": 0.09584367871284485,
+ "mean_token_accuracy": 0.9685114495456218,
+ "num_tokens": 6118148.0,
+ "step": 2620
+ },
+ {
+ "epoch": 6.518057285180573,
+ "eval_entropy": 0.2863075934177221,
+ "eval_loss": 0.7539381384849548,
+ "eval_mean_token_accuracy": 0.8507507083027862,
+ "eval_num_tokens": 6118148.0,
+ "eval_runtime": 86.112,
+ "eval_samples_per_second": 15.968,
+ "eval_steps_per_second": 1.997,
+ "step": 2620
+ },
+ {
+ "entropy": 0.16197575423866512,
+ "epoch": 6.567870485678705,
+ "grad_norm": 0.534295380115509,
+ "learning_rate": 7.205348218055678e-05,
+ "loss": 0.0961170256137848,
+ "mean_token_accuracy": 0.9674530044198036,
+ "num_tokens": 6165523.0,
+ "step": 2640
+ },
+ {
+ "epoch": 6.567870485678705,
+ "eval_entropy": 0.29021967315050057,
+ "eval_loss": 0.751198947429657,
+ "eval_mean_token_accuracy": 0.8509796344956686,
+ "eval_num_tokens": 6165523.0,
+ "eval_runtime": 85.7958,
+ "eval_samples_per_second": 16.026,
+ "eval_steps_per_second": 2.005,
+ "step": 2640
+ },
+ {
+ "entropy": 0.15261746793985367,
+ "epoch": 6.617683686176837,
+ "grad_norm": 0.5391237139701843,
+ "learning_rate": 7.022906815301673e-05,
+ "loss": 0.0926026999950409,
+ "mean_token_accuracy": 0.9695659473538398,
+ "num_tokens": 6216232.0,
+ "step": 2660
+ },
+ {
+ "epoch": 6.617683686176837,
+ "eval_entropy": 0.29128045216202736,
+ "eval_loss": 0.7450292110443115,
+ "eval_mean_token_accuracy": 0.8498771443616512,
+ "eval_num_tokens": 6216232.0,
+ "eval_runtime": 86.3963,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 2660
+ },
+ {
+ "entropy": 0.16164180357009172,
+ "epoch": 6.667496886674969,
+ "grad_norm": 0.5767946243286133,
+ "learning_rate": 6.841759539535419e-05,
+ "loss": 0.09291981458663941,
+ "mean_token_accuracy": 0.9687136687338352,
+ "num_tokens": 6264807.0,
+ "step": 2680
+ },
+ {
+ "epoch": 6.667496886674969,
+ "eval_entropy": 0.2897637223088464,
+ "eval_loss": 0.7503410577774048,
+ "eval_mean_token_accuracy": 0.8503315164599308,
+ "eval_num_tokens": 6264807.0,
+ "eval_runtime": 86.0653,
+ "eval_samples_per_second": 15.976,
+ "eval_steps_per_second": 1.998,
+ "step": 2680
+ },
+ {
+ "entropy": 0.17062523355707526,
+ "epoch": 6.717310087173101,
+ "grad_norm": 0.4974168539047241,
+ "learning_rate": 6.661961022304563e-05,
+ "loss": 0.09713236689567566,
+ "mean_token_accuracy": 0.9661971725523472,
+ "num_tokens": 6308819.0,
+ "step": 2700
+ },
+ {
+ "epoch": 6.717310087173101,
+ "eval_entropy": 0.2765843396963075,
+ "eval_loss": 0.7604002356529236,
+ "eval_mean_token_accuracy": 0.8521115277395692,
+ "eval_num_tokens": 6308819.0,
+ "eval_runtime": 86.1676,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 2700
+ },
+ {
+ "entropy": 0.17544092936441302,
+ "epoch": 6.767123287671232,
+ "grad_norm": 0.5523537993431091,
+ "learning_rate": 6.483565488389582e-05,
+ "loss": 0.09709116220474243,
+ "mean_token_accuracy": 0.9650957375764847,
+ "num_tokens": 6352548.0,
+ "step": 2720
+ },
+ {
+ "epoch": 6.767123287671232,
+ "eval_entropy": 0.27939334659035814,
+ "eval_loss": 0.7534670829772949,
+ "eval_mean_token_accuracy": 0.851230604010959,
+ "eval_num_tokens": 6352548.0,
+ "eval_runtime": 86.2913,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 2720
+ },
+ {
+ "entropy": 0.15991022661328316,
+ "epoch": 6.816936488169365,
+ "grad_norm": 0.478551983833313,
+ "learning_rate": 6.306626739450311e-05,
+ "loss": 0.09564646482467651,
+ "mean_token_accuracy": 0.9679084822535515,
+ "num_tokens": 6397720.0,
+ "step": 2740
+ },
+ {
+ "epoch": 6.816936488169365,
+ "eval_entropy": 0.27878295491601146,
+ "eval_loss": 0.7519959211349487,
+ "eval_mean_token_accuracy": 0.8510654949864676,
+ "eval_num_tokens": 6397720.0,
+ "eval_runtime": 85.9109,
+ "eval_samples_per_second": 16.005,
+ "eval_steps_per_second": 2.002,
+ "step": 2740
+ },
+ {
+ "entropy": 0.16824879590421915,
+ "epoch": 6.866749688667497,
+ "grad_norm": 0.6681098937988281,
+ "learning_rate": 6.131198137800108e-05,
+ "loss": 0.0962279736995697,
+ "mean_token_accuracy": 0.966830012947321,
+ "num_tokens": 6442821.0,
+ "step": 2760
+ },
+ {
+ "epoch": 6.866749688667497,
+ "eval_entropy": 0.2834690434121808,
+ "eval_loss": 0.751922070980072,
+ "eval_mean_token_accuracy": 0.8521237577809844,
+ "eval_num_tokens": 6442821.0,
+ "eval_runtime": 86.3618,
+ "eval_samples_per_second": 15.921,
+ "eval_steps_per_second": 1.992,
+ "step": 2760
+ },
+ {
+ "entropy": 0.1518704930320382,
+ "epoch": 6.916562889165629,
+ "grad_norm": 0.5201290249824524,
+ "learning_rate": 5.957332590312513e-05,
+ "loss": 0.09010660648345947,
+ "mean_token_accuracy": 0.9693463340401649,
+ "num_tokens": 6494118.0,
+ "step": 2780
+ },
+ {
+ "epoch": 6.916562889165629,
+ "eval_entropy": 0.28485129617674404,
+ "eval_loss": 0.7452457547187805,
+ "eval_mean_token_accuracy": 0.8512036796919135,
+ "eval_num_tokens": 6494118.0,
+ "eval_runtime": 86.4524,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2780
+ },
+ {
+ "entropy": 0.15512610590085388,
+ "epoch": 6.966376089663761,
+ "grad_norm": 0.42802050709724426,
+ "learning_rate": 5.785082532465233e-05,
+ "loss": 0.09320432543754578,
+ "mean_token_accuracy": 0.9686134628951549,
+ "num_tokens": 6540175.0,
+ "step": 2800
+ },
+ {
+ "epoch": 6.966376089663761,
+ "eval_entropy": 0.27554594526110693,
+ "eval_loss": 0.7644653916358948,
+ "eval_mean_token_accuracy": 0.8513738523389018,
+ "eval_num_tokens": 6540175.0,
+ "eval_runtime": 85.7609,
+ "eval_samples_per_second": 16.033,
+ "eval_steps_per_second": 2.006,
+ "step": 2800
+ },
+ {
+ "entropy": 0.17524497526196334,
+ "epoch": 7.01494396014944,
+ "grad_norm": 0.3330269157886505,
+ "learning_rate": 5.6144999125263545e-05,
+ "loss": 0.0895616888999939,
+ "mean_token_accuracy": 0.9682766932707566,
+ "num_tokens": 6583767.0,
+ "step": 2820
+ },
+ {
+ "epoch": 7.01494396014944,
+ "eval_entropy": 0.2735865569218647,
+ "eval_loss": 0.768479585647583,
+ "eval_mean_token_accuracy": 0.8503459383581959,
+ "eval_num_tokens": 6583767.0,
+ "eval_runtime": 85.7162,
+ "eval_samples_per_second": 16.041,
+ "eval_steps_per_second": 2.007,
+ "step": 2820
+ },
+ {
+ "entropy": 0.1403565663844347,
+ "epoch": 7.064757160647572,
+ "grad_norm": 0.35613498091697693,
+ "learning_rate": 5.4456361758874235e-05,
+ "loss": 0.07551313638687134,
+ "mean_token_accuracy": 0.9739301167428493,
+ "num_tokens": 6627672.0,
+ "step": 2840
+ },
+ {
+ "epoch": 7.064757160647572,
+ "eval_entropy": 0.25941789089593775,
+ "eval_loss": 0.8209511637687683,
+ "eval_mean_token_accuracy": 0.8505055855873019,
+ "eval_num_tokens": 6627672.0,
+ "eval_runtime": 86.0943,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 2840
+ },
+ {
+ "entropy": 0.13500106502324344,
+ "epoch": 7.114570361145703,
+ "grad_norm": 0.34418627619743347,
+ "learning_rate": 5.2785422495482234e-05,
+ "loss": 0.07293946146965027,
+ "mean_token_accuracy": 0.9747208289802074,
+ "num_tokens": 6672946.0,
+ "step": 2860
+ },
+ {
+ "epoch": 7.114570361145703,
+ "eval_entropy": 0.26482899772912954,
+ "eval_loss": 0.798904538154602,
+ "eval_mean_token_accuracy": 0.8511530233677044,
+ "eval_num_tokens": 6672946.0,
+ "eval_runtime": 85.7915,
+ "eval_samples_per_second": 16.027,
+ "eval_steps_per_second": 2.005,
+ "step": 2860
+ },
+ {
+ "entropy": 0.13127502552233636,
+ "epoch": 7.164383561643835,
+ "grad_norm": 0.4638441503047943,
+ "learning_rate": 5.113268526757892e-05,
+ "loss": 0.07121461629867554,
+ "mean_token_accuracy": 0.9756786689162255,
+ "num_tokens": 6718582.0,
+ "step": 2880
+ },
+ {
+ "epoch": 7.164383561643835,
+ "eval_entropy": 0.2645381211714689,
+ "eval_loss": 0.809101939201355,
+ "eval_mean_token_accuracy": 0.8514727898115335,
+ "eval_num_tokens": 6718582.0,
+ "eval_runtime": 85.84,
+ "eval_samples_per_second": 16.018,
+ "eval_steps_per_second": 2.004,
+ "step": 2880
+ },
+ {
+ "entropy": 0.1331390908919275,
+ "epoch": 7.214196762141968,
+ "grad_norm": 0.40206775069236755,
+ "learning_rate": 4.949864851817007e-05,
+ "loss": 0.07188264131546021,
+ "mean_token_accuracy": 0.9755406074225903,
+ "num_tokens": 6764387.0,
+ "step": 2900
+ },
+ {
+ "epoch": 7.214196762141968,
+ "eval_entropy": 0.26244733283339544,
+ "eval_loss": 0.8143188953399658,
+ "eval_mean_token_accuracy": 0.8514358189909957,
+ "eval_num_tokens": 6764387.0,
+ "eval_runtime": 85.8546,
+ "eval_samples_per_second": 16.015,
+ "eval_steps_per_second": 2.003,
+ "step": 2900
+ },
+ {
+ "entropy": 0.13647331558167936,
+ "epoch": 7.2640099626401,
+ "grad_norm": 0.26405787467956543,
+ "learning_rate": 4.788380505045224e-05,
+ "loss": 0.07412450313568116,
+ "mean_token_accuracy": 0.9744274213910102,
+ "num_tokens": 6809678.0,
+ "step": 2920
+ },
+ {
+ "epoch": 7.2640099626401,
+ "eval_entropy": 0.2626111418182074,
+ "eval_loss": 0.8111525177955627,
+ "eval_mean_token_accuracy": 0.8512121695418691,
+ "eval_num_tokens": 6809678.0,
+ "eval_runtime": 85.9626,
+ "eval_samples_per_second": 15.995,
+ "eval_steps_per_second": 2.001,
+ "step": 2920
+ },
+ {
+ "entropy": 0.12644002586603165,
+ "epoch": 7.313823163138232,
+ "grad_norm": 0.27514681220054626,
+ "learning_rate": 4.6288641879189884e-05,
+ "loss": 0.06807711124420165,
+ "mean_token_accuracy": 0.9760703906416893,
+ "num_tokens": 6860750.0,
+ "step": 2940
+ },
+ {
+ "epoch": 7.313823163138232,
+ "eval_entropy": 0.26096762734097106,
+ "eval_loss": 0.8184595108032227,
+ "eval_mean_token_accuracy": 0.8501476153384807,
+ "eval_num_tokens": 6860750.0,
+ "eval_runtime": 85.9521,
+ "eval_samples_per_second": 15.997,
+ "eval_steps_per_second": 2.001,
+ "step": 2940
+ },
+ {
+ "entropy": 0.13920630998909472,
+ "epoch": 7.363636363636363,
+ "grad_norm": 0.23584705591201782,
+ "learning_rate": 4.4713640083838604e-05,
+ "loss": 0.07301607131958007,
+ "mean_token_accuracy": 0.9745715200901032,
+ "num_tokens": 6907092.0,
+ "step": 2960
+ },
+ {
+ "epoch": 7.363636363636363,
+ "eval_entropy": 0.2612536767021168,
+ "eval_loss": 0.8116245269775391,
+ "eval_mean_token_accuracy": 0.8510967350976412,
+ "eval_num_tokens": 6907092.0,
+ "eval_runtime": 85.6373,
+ "eval_samples_per_second": 16.056,
+ "eval_steps_per_second": 2.008,
+ "step": 2960
+ },
+ {
+ "entropy": 0.1349492883309722,
+ "epoch": 7.4134495641344955,
+ "grad_norm": 0.24552719295024872,
+ "learning_rate": 4.315927466345791e-05,
+ "loss": 0.07397544980049134,
+ "mean_token_accuracy": 0.9745095103979111,
+ "num_tokens": 6952700.0,
+ "step": 2980
+ },
+ {
+ "epoch": 7.4134495641344955,
+ "eval_entropy": 0.25796533306670744,
+ "eval_loss": 0.8266491293907166,
+ "eval_mean_token_accuracy": 0.8511653857868772,
+ "eval_num_tokens": 6952700.0,
+ "eval_runtime": 85.7462,
+ "eval_samples_per_second": 16.036,
+ "eval_steps_per_second": 2.006,
+ "step": 2980
+ },
+ {
+ "entropy": 0.14479175000451505,
+ "epoch": 7.463262764632628,
+ "grad_norm": 0.2846072018146515,
+ "learning_rate": 4.162601439345814e-05,
+ "loss": 0.07544798254966736,
+ "mean_token_accuracy": 0.9727819666266442,
+ "num_tokens": 6996430.0,
+ "step": 3000
+ },
+ {
+ "epoch": 7.463262764632628,
+ "eval_entropy": 0.2584348309698493,
+ "eval_loss": 0.8253348469734192,
+ "eval_mean_token_accuracy": 0.8511569815319638,
+ "eval_num_tokens": 6996430.0,
+ "eval_runtime": 86.2984,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 3000
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.949801451453624e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3020/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3020/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3020/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3020/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3020/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3020/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3020/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3020/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3020/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3020/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3020/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3020/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3020/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3020/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..f7e9580a673bd691e9d60705b512cbb7fbc04d02
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3020/trainer_state.json
@@ -0,0 +1,3205 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 7.51307596513076,
+ "eval_steps": 20,
+ "global_step": 3020,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ },
+ {
+ "entropy": 0.3193941755220294,
+ "epoch": 4.5280199252802,
+ "grad_norm": 0.8281906843185425,
+ "learning_rate": 0.0001509111761786888,
+ "loss": 0.23936262130737304,
+ "mean_token_accuracy": 0.9201708927750587,
+ "num_tokens": 4244423.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.5280199252802,
+ "eval_entropy": 0.38704028864239537,
+ "eval_loss": 0.6006569266319275,
+ "eval_mean_token_accuracy": 0.8502406720505205,
+ "eval_num_tokens": 4244423.0,
+ "eval_runtime": 86.8059,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1820
+ },
+ {
+ "entropy": 0.3164879363030195,
+ "epoch": 4.577833125778331,
+ "grad_norm": 0.7892968654632568,
+ "learning_rate": 0.00014905346557909867,
+ "loss": 0.24541733264923096,
+ "mean_token_accuracy": 0.9175932116806507,
+ "num_tokens": 4289773.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.577833125778331,
+ "eval_entropy": 0.38861122120951497,
+ "eval_loss": 0.6115967631340027,
+ "eval_mean_token_accuracy": 0.849471275196519,
+ "eval_num_tokens": 4289773.0,
+ "eval_runtime": 86.2946,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1840
+ },
+ {
+ "entropy": 0.3051785985007882,
+ "epoch": 4.627646326276463,
+ "grad_norm": 0.8109654188156128,
+ "learning_rate": 0.0001471849238862319,
+ "loss": 0.23433220386505127,
+ "mean_token_accuracy": 0.9206570319831371,
+ "num_tokens": 4336894.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.627646326276463,
+ "eval_entropy": 0.37162452295076015,
+ "eval_loss": 0.6184061765670776,
+ "eval_mean_token_accuracy": 0.8501173268223918,
+ "eval_num_tokens": 4336894.0,
+ "eval_runtime": 86.6865,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1860
+ },
+ {
+ "entropy": 0.3168198253959417,
+ "epoch": 4.677459526774595,
+ "grad_norm": 0.9512342214584351,
+ "learning_rate": 0.0001453061146267775,
+ "loss": 0.23832404613494873,
+ "mean_token_accuracy": 0.9197044663131237,
+ "num_tokens": 4382947.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.677459526774595,
+ "eval_entropy": 0.3845940856912801,
+ "eval_loss": 0.606762707233429,
+ "eval_mean_token_accuracy": 0.8504838194957999,
+ "eval_num_tokens": 4382947.0,
+ "eval_runtime": 86.5175,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 1880
+ },
+ {
+ "entropy": 0.30791807882487776,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 0.8123113512992859,
+ "learning_rate": 0.00014341760442398248,
+ "loss": 0.2395785331726074,
+ "mean_token_accuracy": 0.918928150832653,
+ "num_tokens": 4433050.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.7272727272727275,
+ "eval_entropy": 0.39762327222283494,
+ "eval_loss": 0.5994202494621277,
+ "eval_mean_token_accuracy": 0.8509274201337681,
+ "eval_num_tokens": 4433050.0,
+ "eval_runtime": 86.2873,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.993,
+ "step": 1900
+ },
+ {
+ "entropy": 0.3021434534341097,
+ "epoch": 4.777085927770859,
+ "grad_norm": 0.731787383556366,
+ "learning_rate": 0.000141519962826766,
+ "loss": 0.23494718074798585,
+ "mean_token_accuracy": 0.9201403826475143,
+ "num_tokens": 4483598.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.777085927770859,
+ "eval_entropy": 0.3827026732439219,
+ "eval_loss": 0.5995895862579346,
+ "eval_mean_token_accuracy": 0.851468373523202,
+ "eval_num_tokens": 4483598.0,
+ "eval_runtime": 86.3006,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 1920
+ },
+ {
+ "entropy": 0.31626159623265265,
+ "epoch": 4.826899128268991,
+ "grad_norm": 0.8848487138748169,
+ "learning_rate": 0.00013961376213795132,
+ "loss": 0.2439030647277832,
+ "mean_token_accuracy": 0.9196575872600079,
+ "num_tokens": 4529201.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.826899128268991,
+ "eval_entropy": 0.388698436839636,
+ "eval_loss": 0.6000174283981323,
+ "eval_mean_token_accuracy": 0.8518068187458571,
+ "eval_num_tokens": 4529201.0,
+ "eval_runtime": 86.8979,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.979,
+ "step": 1940
+ },
+ {
+ "entropy": 0.30520407035946845,
+ "epoch": 4.876712328767123,
+ "grad_norm": 0.8532460927963257,
+ "learning_rate": 0.00013769957724166695,
+ "loss": 0.23458616733551024,
+ "mean_token_accuracy": 0.9221912942826748,
+ "num_tokens": 4578167.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.876712328767123,
+ "eval_entropy": 0.38777847102908203,
+ "eval_loss": 0.6004981398582458,
+ "eval_mean_token_accuracy": 0.8516481768253238,
+ "eval_num_tokens": 4578167.0,
+ "eval_runtime": 87.0777,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.975,
+ "step": 1960
+ },
+ {
+ "entropy": 0.3226448342204094,
+ "epoch": 4.926525529265255,
+ "grad_norm": 0.6945561766624451,
+ "learning_rate": 0.0001357779854299694,
+ "loss": 0.24048397541046143,
+ "mean_token_accuracy": 0.9195300146937371,
+ "num_tokens": 4622316.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.926525529265255,
+ "eval_entropy": 0.38581624263247777,
+ "eval_loss": 0.6029234528541565,
+ "eval_mean_token_accuracy": 0.8514213260523108,
+ "eval_num_tokens": 4622316.0,
+ "eval_runtime": 85.8729,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 1980
+ },
+ {
+ "entropy": 0.3051655298098922,
+ "epoch": 4.976338729763388,
+ "grad_norm": 0.7976452708244324,
+ "learning_rate": 0.00013384956622874001,
+ "loss": 0.23584742546081544,
+ "mean_token_accuracy": 0.9216851457953453,
+ "num_tokens": 4670746.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.976338729763388,
+ "eval_entropy": 0.37913159246361533,
+ "eval_loss": 0.6057604551315308,
+ "eval_mean_token_accuracy": 0.8525801203971686,
+ "eval_num_tokens": 4670746.0,
+ "eval_runtime": 86.1145,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2000
+ },
+ {
+ "entropy": 0.27438195240803254,
+ "epoch": 5.024906600249066,
+ "grad_norm": 0.6729586124420166,
+ "learning_rate": 0.0001319149012229075,
+ "loss": 0.19775952100753785,
+ "mean_token_accuracy": 0.9339428559327737,
+ "num_tokens": 4716176.0,
+ "step": 2020
+ },
+ {
+ "epoch": 5.024906600249066,
+ "eval_entropy": 0.3448961910813354,
+ "eval_loss": 0.6750120520591736,
+ "eval_mean_token_accuracy": 0.8487970232963562,
+ "eval_num_tokens": 4716176.0,
+ "eval_runtime": 86.1169,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2020
+ },
+ {
+ "entropy": 0.21423916313797237,
+ "epoch": 5.074719800747198,
+ "grad_norm": 0.6934391856193542,
+ "learning_rate": 0.00012997457388105022,
+ "loss": 0.1439570426940918,
+ "mean_token_accuracy": 0.9528236843645572,
+ "num_tokens": 4763269.0,
+ "step": 2040
+ },
+ {
+ "epoch": 5.074719800747198,
+ "eval_entropy": 0.3570949243771475,
+ "eval_loss": 0.6465504169464111,
+ "eval_mean_token_accuracy": 0.8490785547467166,
+ "eval_num_tokens": 4763269.0,
+ "eval_runtime": 85.9574,
+ "eval_samples_per_second": 15.996,
+ "eval_steps_per_second": 2.001,
+ "step": 2040
+ },
+ {
+ "entropy": 0.20838565267622472,
+ "epoch": 5.12453300124533,
+ "grad_norm": 0.7286986112594604,
+ "learning_rate": 0.00012802916937942972,
+ "loss": 0.14467307329177856,
+ "mean_token_accuracy": 0.950994835793972,
+ "num_tokens": 4809047.0,
+ "step": 2060
+ },
+ {
+ "epoch": 5.12453300124533,
+ "eval_entropy": 0.3452463157821533,
+ "eval_loss": 0.6705958843231201,
+ "eval_mean_token_accuracy": 0.8490352796953778,
+ "eval_num_tokens": 4809047.0,
+ "eval_runtime": 86.228,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 2060
+ },
+ {
+ "entropy": 0.20453082229942082,
+ "epoch": 5.174346201743462,
+ "grad_norm": 0.7515555620193481,
+ "learning_rate": 0.00012607927442550974,
+ "loss": 0.13732000589370727,
+ "mean_token_accuracy": 0.9537357829511166,
+ "num_tokens": 4857965.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.174346201743462,
+ "eval_entropy": 0.32431264914745506,
+ "eval_loss": 0.6743043065071106,
+ "eval_mean_token_accuracy": 0.8504878629085629,
+ "eval_num_tokens": 4857965.0,
+ "eval_runtime": 86.5948,
+ "eval_samples_per_second": 15.879,
+ "eval_steps_per_second": 1.986,
+ "step": 2080
+ },
+ {
+ "entropy": 0.21812320686876774,
+ "epoch": 5.224159402241594,
+ "grad_norm": 0.9093465209007263,
+ "learning_rate": 0.0001241254770810132,
+ "loss": 0.14311420917510986,
+ "mean_token_accuracy": 0.9514068141579628,
+ "num_tokens": 4905151.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.224159402241594,
+ "eval_entropy": 0.33086285835435225,
+ "eval_loss": 0.6676449179649353,
+ "eval_mean_token_accuracy": 0.8505287662495015,
+ "eval_num_tokens": 4905151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 2100
+ },
+ {
+ "entropy": 0.2180163251236081,
+ "epoch": 5.273972602739726,
+ "grad_norm": 0.6703007221221924,
+ "learning_rate": 0.00012216836658457075,
+ "loss": 0.14803968667984008,
+ "mean_token_accuracy": 0.9521303348243236,
+ "num_tokens": 4947072.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.273972602739726,
+ "eval_entropy": 0.33162341708707255,
+ "eval_loss": 0.6658875942230225,
+ "eval_mean_token_accuracy": 0.8500757605530495,
+ "eval_num_tokens": 4947072.0,
+ "eval_runtime": 86.6296,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 2120
+ },
+ {
+ "entropy": 0.22511130161583423,
+ "epoch": 5.323785803237858,
+ "grad_norm": 0.8078880906105042,
+ "learning_rate": 0.00012020853317401455,
+ "loss": 0.15228408575057983,
+ "mean_token_accuracy": 0.947144789993763,
+ "num_tokens": 4991974.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.323785803237858,
+ "eval_entropy": 0.3354601170434508,
+ "eval_loss": 0.6677829623222351,
+ "eval_mean_token_accuracy": 0.8482600024273229,
+ "eval_num_tokens": 4991974.0,
+ "eval_runtime": 86.4689,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.989,
+ "step": 2140
+ },
+ {
+ "entropy": 0.2244176059961319,
+ "epoch": 5.37359900373599,
+ "grad_norm": 0.9636075496673584,
+ "learning_rate": 0.00011824656790837037,
+ "loss": 0.15260883569717407,
+ "mean_token_accuracy": 0.9471467643976211,
+ "num_tokens": 5038400.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.37359900373599,
+ "eval_entropy": 0.3381616926297199,
+ "eval_loss": 0.6694412231445312,
+ "eval_mean_token_accuracy": 0.8482369603805764,
+ "eval_num_tokens": 5038400.0,
+ "eval_runtime": 86.4147,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 2160
+ },
+ {
+ "entropy": 0.22982364390045404,
+ "epoch": 5.423412204234122,
+ "grad_norm": 0.775401771068573,
+ "learning_rate": 0.00011628306248960262,
+ "loss": 0.15140302181243898,
+ "mean_token_accuracy": 0.9492553934454918,
+ "num_tokens": 5083166.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.423412204234122,
+ "eval_entropy": 0.3305150235808173,
+ "eval_loss": 0.6717822551727295,
+ "eval_mean_token_accuracy": 0.8489849723355715,
+ "eval_num_tokens": 5083166.0,
+ "eval_runtime": 86.4728,
+ "eval_samples_per_second": 15.901,
+ "eval_steps_per_second": 1.989,
+ "step": 2180
+ },
+ {
+ "entropy": 0.21448935717344284,
+ "epoch": 5.473225404732254,
+ "grad_norm": 0.6575281023979187,
+ "learning_rate": 0.00011431860908416465,
+ "loss": 0.1452319622039795,
+ "mean_token_accuracy": 0.9505287684500218,
+ "num_tokens": 5135109.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.473225404732254,
+ "eval_entropy": 0.3488145174328671,
+ "eval_loss": 0.6612305641174316,
+ "eval_mean_token_accuracy": 0.8492907808963642,
+ "eval_num_tokens": 5135109.0,
+ "eval_runtime": 86.6927,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 2200
+ },
+ {
+ "entropy": 0.23091202937066554,
+ "epoch": 5.523038605230386,
+ "grad_norm": 0.8909686207771301,
+ "learning_rate": 0.00011235380014440985,
+ "loss": 0.15150139331817628,
+ "mean_token_accuracy": 0.9497875183820724,
+ "num_tokens": 5180138.0,
+ "step": 2220
+ },
+ {
+ "epoch": 5.523038605230386,
+ "eval_entropy": 0.3268539015810157,
+ "eval_loss": 0.6667542457580566,
+ "eval_mean_token_accuracy": 0.8499062903398691,
+ "eval_num_tokens": 5180138.0,
+ "eval_runtime": 86.4644,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 2220
+ },
+ {
+ "entropy": 0.2227974807843566,
+ "epoch": 5.572851805728518,
+ "grad_norm": 0.6180275082588196,
+ "learning_rate": 0.0001103892282299158,
+ "loss": 0.1491069197654724,
+ "mean_token_accuracy": 0.9488144010305405,
+ "num_tokens": 5226864.0,
+ "step": 2240
+ },
+ {
+ "epoch": 5.572851805728518,
+ "eval_entropy": 0.3346347655494546,
+ "eval_loss": 0.6665948629379272,
+ "eval_mean_token_accuracy": 0.8499961893918903,
+ "eval_num_tokens": 5226864.0,
+ "eval_runtime": 87.0548,
+ "eval_samples_per_second": 15.795,
+ "eval_steps_per_second": 1.976,
+ "step": 2240
+ },
+ {
+ "entropy": 0.21368421968072654,
+ "epoch": 5.62266500622665,
+ "grad_norm": 0.6004369258880615,
+ "learning_rate": 0.00010842548582877651,
+ "loss": 0.14485255479812623,
+ "mean_token_accuracy": 0.9502056457102299,
+ "num_tokens": 5276602.0,
+ "step": 2260
+ },
+ {
+ "epoch": 5.62266500622665,
+ "eval_entropy": 0.32753298804163933,
+ "eval_loss": 0.6680151224136353,
+ "eval_mean_token_accuracy": 0.8515451086121936,
+ "eval_num_tokens": 5276602.0,
+ "eval_runtime": 86.8524,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.98,
+ "step": 2260
+ },
+ {
+ "entropy": 0.2103635374456644,
+ "epoch": 5.672478206724782,
+ "grad_norm": 0.699174702167511,
+ "learning_rate": 0.00010646316517891613,
+ "loss": 0.14297772645950318,
+ "mean_token_accuracy": 0.9512537539005279,
+ "num_tokens": 5323718.0,
+ "step": 2280
+ },
+ {
+ "epoch": 5.672478206724782,
+ "eval_entropy": 0.32966585959806,
+ "eval_loss": 0.675578773021698,
+ "eval_mean_token_accuracy": 0.8509623023659684,
+ "eval_num_tokens": 5323718.0,
+ "eval_runtime": 86.4518,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2280
+ },
+ {
+ "entropy": 0.22516900151968003,
+ "epoch": 5.722291407222914,
+ "grad_norm": 0.6637354493141174,
+ "learning_rate": 0.00010450285808947797,
+ "loss": 0.15202572345733642,
+ "mean_token_accuracy": 0.9482452072203159,
+ "num_tokens": 5369039.0,
+ "step": 2300
+ },
+ {
+ "epoch": 5.722291407222914,
+ "eval_entropy": 0.3369456917740578,
+ "eval_loss": 0.6697061061859131,
+ "eval_mean_token_accuracy": 0.848603522361711,
+ "eval_num_tokens": 5369039.0,
+ "eval_runtime": 86.6371,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.985,
+ "step": 2300
+ },
+ {
+ "entropy": 0.21841065725311637,
+ "epoch": 5.772104607721046,
+ "grad_norm": 0.7940268516540527,
+ "learning_rate": 0.00010254515576234297,
+ "loss": 0.14710167646408082,
+ "mean_token_accuracy": 0.9493498183786869,
+ "num_tokens": 5417029.0,
+ "step": 2320
+ },
+ {
+ "epoch": 5.772104607721046,
+ "eval_entropy": 0.3237486180177955,
+ "eval_loss": 0.6779657602310181,
+ "eval_mean_token_accuracy": 0.8500715313955794,
+ "eval_num_tokens": 5417029.0,
+ "eval_runtime": 86.1826,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 1.996,
+ "step": 2320
+ },
+ {
+ "entropy": 0.22146204356104135,
+ "epoch": 5.821917808219178,
+ "grad_norm": 0.9234833121299744,
+ "learning_rate": 0.00010059064861383132,
+ "loss": 0.14720046520233154,
+ "mean_token_accuracy": 0.9493872679769992,
+ "num_tokens": 5461671.0,
+ "step": 2340
+ },
+ {
+ "epoch": 5.821917808219178,
+ "eval_entropy": 0.32365207564692167,
+ "eval_loss": 0.6704005002975464,
+ "eval_mean_token_accuracy": 0.8507985760306203,
+ "eval_num_tokens": 5461671.0,
+ "eval_runtime": 86.5494,
+ "eval_samples_per_second": 15.887,
+ "eval_steps_per_second": 1.987,
+ "step": 2340
+ },
+ {
+ "entropy": 0.20934011954814197,
+ "epoch": 5.87173100871731,
+ "grad_norm": 0.5547503232955933,
+ "learning_rate": 9.863992609664084e-05,
+ "loss": 0.1464867353439331,
+ "mean_token_accuracy": 0.9503875687718392,
+ "num_tokens": 5509312.0,
+ "step": 2360
+ },
+ {
+ "epoch": 5.87173100871731,
+ "eval_entropy": 0.3330401429083458,
+ "eval_loss": 0.6659091114997864,
+ "eval_mean_token_accuracy": 0.8504848906467127,
+ "eval_num_tokens": 5509312.0,
+ "eval_runtime": 86.5855,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 2360
+ },
+ {
+ "entropy": 0.21678635366261007,
+ "epoch": 5.921544209215442,
+ "grad_norm": 0.570612907409668,
+ "learning_rate": 9.669357652207635e-05,
+ "loss": 0.14821385145187377,
+ "mean_token_accuracy": 0.9503940217196941,
+ "num_tokens": 5558196.0,
+ "step": 2380
+ },
+ {
+ "epoch": 5.921544209215442,
+ "eval_entropy": 0.3322022325077722,
+ "eval_loss": 0.6722489595413208,
+ "eval_mean_token_accuracy": 0.8489979422369669,
+ "eval_num_tokens": 5558196.0,
+ "eval_runtime": 86.2986,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 2380
+ },
+ {
+ "entropy": 0.20932920072227718,
+ "epoch": 5.971357409713574,
+ "grad_norm": 0.7879557609558105,
+ "learning_rate": 9.475218688262262e-05,
+ "loss": 0.14675841331481934,
+ "mean_token_accuracy": 0.9507176131010056,
+ "num_tokens": 5605400.0,
+ "step": 2400
+ },
+ {
+ "epoch": 5.971357409713574,
+ "eval_entropy": 0.3199348642902319,
+ "eval_loss": 0.6698136329650879,
+ "eval_mean_token_accuracy": 0.8514142130003419,
+ "eval_num_tokens": 5605400.0,
+ "eval_runtime": 85.8995,
+ "eval_samples_per_second": 16.007,
+ "eval_steps_per_second": 2.002,
+ "step": 2400
+ },
+ {
+ "entropy": 0.21032143919131693,
+ "epoch": 6.019925280199253,
+ "grad_norm": 0.5823076367378235,
+ "learning_rate": 9.281634267491569e-05,
+ "loss": 0.13322267532348633,
+ "mean_token_accuracy": 0.9550939072401096,
+ "num_tokens": 5648968.0,
+ "step": 2420
+ },
+ {
+ "epoch": 6.019925280199253,
+ "eval_entropy": 0.30206270117399303,
+ "eval_loss": 0.7093168497085571,
+ "eval_mean_token_accuracy": 0.8500627639681794,
+ "eval_num_tokens": 5648968.0,
+ "eval_runtime": 85.8128,
+ "eval_samples_per_second": 16.023,
+ "eval_steps_per_second": 2.004,
+ "step": 2420
+ },
+ {
+ "entropy": 0.1534628233872354,
+ "epoch": 6.069738480697385,
+ "grad_norm": 0.710133969783783,
+ "learning_rate": 9.088662772316508e-05,
+ "loss": 0.09078952670097351,
+ "mean_token_accuracy": 0.9678447999060154,
+ "num_tokens": 5697633.0,
+ "step": 2440
+ },
+ {
+ "epoch": 6.069738480697385,
+ "eval_entropy": 0.28208133101809857,
+ "eval_loss": 0.7636417150497437,
+ "eval_mean_token_accuracy": 0.8494061477655588,
+ "eval_num_tokens": 5697633.0,
+ "eval_runtime": 85.9724,
+ "eval_samples_per_second": 15.994,
+ "eval_steps_per_second": 2.001,
+ "step": 2440
+ },
+ {
+ "entropy": 0.16151462448760867,
+ "epoch": 6.119551681195516,
+ "grad_norm": 0.5793812274932861,
+ "learning_rate": 8.896362400308028e-05,
+ "loss": 0.09545697569847107,
+ "mean_token_accuracy": 0.9671573750674725,
+ "num_tokens": 5745090.0,
+ "step": 2460
+ },
+ {
+ "epoch": 6.119551681195516,
+ "eval_entropy": 0.2833245605403601,
+ "eval_loss": 0.7402405738830566,
+ "eval_mean_token_accuracy": 0.8503523728875226,
+ "eval_num_tokens": 5745090.0,
+ "eval_runtime": 85.5461,
+ "eval_samples_per_second": 16.073,
+ "eval_steps_per_second": 2.011,
+ "step": 2460
+ },
+ {
+ "entropy": 0.15203177919611335,
+ "epoch": 6.169364881693649,
+ "grad_norm": 0.4251123368740082,
+ "learning_rate": 8.704791146635483e-05,
+ "loss": 0.09420782327651978,
+ "mean_token_accuracy": 0.9677386932075024,
+ "num_tokens": 5790333.0,
+ "step": 2480
+ },
+ {
+ "epoch": 6.169364881693649,
+ "eval_entropy": 0.28572545962971313,
+ "eval_loss": 0.735416829586029,
+ "eval_mean_token_accuracy": 0.8487084663884584,
+ "eval_num_tokens": 5790333.0,
+ "eval_runtime": 85.4801,
+ "eval_samples_per_second": 16.086,
+ "eval_steps_per_second": 2.012,
+ "step": 2480
+ },
+ {
+ "entropy": 0.15587336672469973,
+ "epoch": 6.219178082191781,
+ "grad_norm": 0.4357028007507324,
+ "learning_rate": 8.514006786576085e-05,
+ "loss": 0.09429320096969604,
+ "mean_token_accuracy": 0.9682952925562859,
+ "num_tokens": 5837321.0,
+ "step": 2500
+ },
+ {
+ "epoch": 6.219178082191781,
+ "eval_entropy": 0.2859006894882335,
+ "eval_loss": 0.7347224950790405,
+ "eval_mean_token_accuracy": 0.8501905518215757,
+ "eval_num_tokens": 5837321.0,
+ "eval_runtime": 85.7578,
+ "eval_samples_per_second": 16.034,
+ "eval_steps_per_second": 2.006,
+ "step": 2500
+ },
+ {
+ "entropy": 0.15765639198943973,
+ "epoch": 6.268991282689913,
+ "grad_norm": 0.47331130504608154,
+ "learning_rate": 8.324066858090663e-05,
+ "loss": 0.09571113586425781,
+ "mean_token_accuracy": 0.9683481335639954,
+ "num_tokens": 5884398.0,
+ "step": 2520
+ },
+ {
+ "epoch": 6.268991282689913,
+ "eval_entropy": 0.29231513846059176,
+ "eval_loss": 0.7392512559890747,
+ "eval_mean_token_accuracy": 0.8486633983462356,
+ "eval_num_tokens": 5884398.0,
+ "eval_runtime": 85.7846,
+ "eval_samples_per_second": 16.029,
+ "eval_steps_per_second": 2.005,
+ "step": 2520
+ },
+ {
+ "entropy": 0.16176860257983208,
+ "epoch": 6.318804483188045,
+ "grad_norm": 0.6142018437385559,
+ "learning_rate": 8.135028644470992e-05,
+ "loss": 0.09486144185066223,
+ "mean_token_accuracy": 0.9682316601276397,
+ "num_tokens": 5929876.0,
+ "step": 2540
+ },
+ {
+ "epoch": 6.318804483188045,
+ "eval_entropy": 0.2851274753379267,
+ "eval_loss": 0.7520816922187805,
+ "eval_mean_token_accuracy": 0.8501113649717597,
+ "eval_num_tokens": 5929876.0,
+ "eval_runtime": 85.9425,
+ "eval_samples_per_second": 15.999,
+ "eval_steps_per_second": 2.001,
+ "step": 2540
+ },
+ {
+ "entropy": 0.15404034564271568,
+ "epoch": 6.3686176836861765,
+ "grad_norm": 0.6051287651062012,
+ "learning_rate": 7.946949157063964e-05,
+ "loss": 0.09280472993850708,
+ "mean_token_accuracy": 0.9684635892510414,
+ "num_tokens": 5978490.0,
+ "step": 2560
+ },
+ {
+ "epoch": 6.3686176836861765,
+ "eval_entropy": 0.28802703563557114,
+ "eval_loss": 0.7439162135124207,
+ "eval_mean_token_accuracy": 0.8499851770872293,
+ "eval_num_tokens": 5978490.0,
+ "eval_runtime": 86.0703,
+ "eval_samples_per_second": 15.975,
+ "eval_steps_per_second": 1.998,
+ "step": 2560
+ },
+ {
+ "entropy": 0.15343588953837753,
+ "epoch": 6.418430884184309,
+ "grad_norm": 0.4823743402957916,
+ "learning_rate": 7.759885118077701e-05,
+ "loss": 0.09000591039657593,
+ "mean_token_accuracy": 0.9699928767979145,
+ "num_tokens": 6025380.0,
+ "step": 2580
+ },
+ {
+ "epoch": 6.418430884184309,
+ "eval_entropy": 0.2795634938533916,
+ "eval_loss": 0.7647850513458252,
+ "eval_mean_token_accuracy": 0.8503464397995971,
+ "eval_num_tokens": 6025380.0,
+ "eval_runtime": 85.8886,
+ "eval_samples_per_second": 16.009,
+ "eval_steps_per_second": 2.003,
+ "step": 2580
+ },
+ {
+ "entropy": 0.15740026142448188,
+ "epoch": 6.468244084682441,
+ "grad_norm": 0.5082696676254272,
+ "learning_rate": 7.57389294347494e-05,
+ "loss": 0.09191849827766418,
+ "mean_token_accuracy": 0.9692809768021107,
+ "num_tokens": 6073349.0,
+ "step": 2600
+ },
+ {
+ "epoch": 6.468244084682441,
+ "eval_entropy": 0.2913342311458532,
+ "eval_loss": 0.7518694996833801,
+ "eval_mean_token_accuracy": 0.8483168302580367,
+ "eval_num_tokens": 6073349.0,
+ "eval_runtime": 85.5761,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.01,
+ "step": 2600
+ },
+ {
+ "entropy": 0.15922069251537324,
+ "epoch": 6.518057285180573,
+ "grad_norm": 0.3995199501514435,
+ "learning_rate": 7.389028725958736e-05,
+ "loss": 0.09584367871284485,
+ "mean_token_accuracy": 0.9685114495456218,
+ "num_tokens": 6118148.0,
+ "step": 2620
+ },
+ {
+ "epoch": 6.518057285180573,
+ "eval_entropy": 0.2863075934177221,
+ "eval_loss": 0.7539381384849548,
+ "eval_mean_token_accuracy": 0.8507507083027862,
+ "eval_num_tokens": 6118148.0,
+ "eval_runtime": 86.112,
+ "eval_samples_per_second": 15.968,
+ "eval_steps_per_second": 1.997,
+ "step": 2620
+ },
+ {
+ "entropy": 0.16197575423866512,
+ "epoch": 6.567870485678705,
+ "grad_norm": 0.534295380115509,
+ "learning_rate": 7.205348218055678e-05,
+ "loss": 0.0961170256137848,
+ "mean_token_accuracy": 0.9674530044198036,
+ "num_tokens": 6165523.0,
+ "step": 2640
+ },
+ {
+ "epoch": 6.567870485678705,
+ "eval_entropy": 0.29021967315050057,
+ "eval_loss": 0.751198947429657,
+ "eval_mean_token_accuracy": 0.8509796344956686,
+ "eval_num_tokens": 6165523.0,
+ "eval_runtime": 85.7958,
+ "eval_samples_per_second": 16.026,
+ "eval_steps_per_second": 2.005,
+ "step": 2640
+ },
+ {
+ "entropy": 0.15261746793985367,
+ "epoch": 6.617683686176837,
+ "grad_norm": 0.5391237139701843,
+ "learning_rate": 7.022906815301673e-05,
+ "loss": 0.0926026999950409,
+ "mean_token_accuracy": 0.9695659473538398,
+ "num_tokens": 6216232.0,
+ "step": 2660
+ },
+ {
+ "epoch": 6.617683686176837,
+ "eval_entropy": 0.29128045216202736,
+ "eval_loss": 0.7450292110443115,
+ "eval_mean_token_accuracy": 0.8498771443616512,
+ "eval_num_tokens": 6216232.0,
+ "eval_runtime": 86.3963,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 2660
+ },
+ {
+ "entropy": 0.16164180357009172,
+ "epoch": 6.667496886674969,
+ "grad_norm": 0.5767946243286133,
+ "learning_rate": 6.841759539535419e-05,
+ "loss": 0.09291981458663941,
+ "mean_token_accuracy": 0.9687136687338352,
+ "num_tokens": 6264807.0,
+ "step": 2680
+ },
+ {
+ "epoch": 6.667496886674969,
+ "eval_entropy": 0.2897637223088464,
+ "eval_loss": 0.7503410577774048,
+ "eval_mean_token_accuracy": 0.8503315164599308,
+ "eval_num_tokens": 6264807.0,
+ "eval_runtime": 86.0653,
+ "eval_samples_per_second": 15.976,
+ "eval_steps_per_second": 1.998,
+ "step": 2680
+ },
+ {
+ "entropy": 0.17062523355707526,
+ "epoch": 6.717310087173101,
+ "grad_norm": 0.4974168539047241,
+ "learning_rate": 6.661961022304563e-05,
+ "loss": 0.09713236689567566,
+ "mean_token_accuracy": 0.9661971725523472,
+ "num_tokens": 6308819.0,
+ "step": 2700
+ },
+ {
+ "epoch": 6.717310087173101,
+ "eval_entropy": 0.2765843396963075,
+ "eval_loss": 0.7604002356529236,
+ "eval_mean_token_accuracy": 0.8521115277395692,
+ "eval_num_tokens": 6308819.0,
+ "eval_runtime": 86.1676,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 2700
+ },
+ {
+ "entropy": 0.17544092936441302,
+ "epoch": 6.767123287671232,
+ "grad_norm": 0.5523537993431091,
+ "learning_rate": 6.483565488389582e-05,
+ "loss": 0.09709116220474243,
+ "mean_token_accuracy": 0.9650957375764847,
+ "num_tokens": 6352548.0,
+ "step": 2720
+ },
+ {
+ "epoch": 6.767123287671232,
+ "eval_entropy": 0.27939334659035814,
+ "eval_loss": 0.7534670829772949,
+ "eval_mean_token_accuracy": 0.851230604010959,
+ "eval_num_tokens": 6352548.0,
+ "eval_runtime": 86.2913,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 2720
+ },
+ {
+ "entropy": 0.15991022661328316,
+ "epoch": 6.816936488169365,
+ "grad_norm": 0.478551983833313,
+ "learning_rate": 6.306626739450311e-05,
+ "loss": 0.09564646482467651,
+ "mean_token_accuracy": 0.9679084822535515,
+ "num_tokens": 6397720.0,
+ "step": 2740
+ },
+ {
+ "epoch": 6.816936488169365,
+ "eval_entropy": 0.27878295491601146,
+ "eval_loss": 0.7519959211349487,
+ "eval_mean_token_accuracy": 0.8510654949864676,
+ "eval_num_tokens": 6397720.0,
+ "eval_runtime": 85.9109,
+ "eval_samples_per_second": 16.005,
+ "eval_steps_per_second": 2.002,
+ "step": 2740
+ },
+ {
+ "entropy": 0.16824879590421915,
+ "epoch": 6.866749688667497,
+ "grad_norm": 0.6681098937988281,
+ "learning_rate": 6.131198137800108e-05,
+ "loss": 0.0962279736995697,
+ "mean_token_accuracy": 0.966830012947321,
+ "num_tokens": 6442821.0,
+ "step": 2760
+ },
+ {
+ "epoch": 6.866749688667497,
+ "eval_entropy": 0.2834690434121808,
+ "eval_loss": 0.751922070980072,
+ "eval_mean_token_accuracy": 0.8521237577809844,
+ "eval_num_tokens": 6442821.0,
+ "eval_runtime": 86.3618,
+ "eval_samples_per_second": 15.921,
+ "eval_steps_per_second": 1.992,
+ "step": 2760
+ },
+ {
+ "entropy": 0.1518704930320382,
+ "epoch": 6.916562889165629,
+ "grad_norm": 0.5201290249824524,
+ "learning_rate": 5.957332590312513e-05,
+ "loss": 0.09010660648345947,
+ "mean_token_accuracy": 0.9693463340401649,
+ "num_tokens": 6494118.0,
+ "step": 2780
+ },
+ {
+ "epoch": 6.916562889165629,
+ "eval_entropy": 0.28485129617674404,
+ "eval_loss": 0.7452457547187805,
+ "eval_mean_token_accuracy": 0.8512036796919135,
+ "eval_num_tokens": 6494118.0,
+ "eval_runtime": 86.4524,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2780
+ },
+ {
+ "entropy": 0.15512610590085388,
+ "epoch": 6.966376089663761,
+ "grad_norm": 0.42802050709724426,
+ "learning_rate": 5.785082532465233e-05,
+ "loss": 0.09320432543754578,
+ "mean_token_accuracy": 0.9686134628951549,
+ "num_tokens": 6540175.0,
+ "step": 2800
+ },
+ {
+ "epoch": 6.966376089663761,
+ "eval_entropy": 0.27554594526110693,
+ "eval_loss": 0.7644653916358948,
+ "eval_mean_token_accuracy": 0.8513738523389018,
+ "eval_num_tokens": 6540175.0,
+ "eval_runtime": 85.7609,
+ "eval_samples_per_second": 16.033,
+ "eval_steps_per_second": 2.006,
+ "step": 2800
+ },
+ {
+ "entropy": 0.17524497526196334,
+ "epoch": 7.01494396014944,
+ "grad_norm": 0.3330269157886505,
+ "learning_rate": 5.6144999125263545e-05,
+ "loss": 0.0895616888999939,
+ "mean_token_accuracy": 0.9682766932707566,
+ "num_tokens": 6583767.0,
+ "step": 2820
+ },
+ {
+ "epoch": 7.01494396014944,
+ "eval_entropy": 0.2735865569218647,
+ "eval_loss": 0.768479585647583,
+ "eval_mean_token_accuracy": 0.8503459383581959,
+ "eval_num_tokens": 6583767.0,
+ "eval_runtime": 85.7162,
+ "eval_samples_per_second": 16.041,
+ "eval_steps_per_second": 2.007,
+ "step": 2820
+ },
+ {
+ "entropy": 0.1403565663844347,
+ "epoch": 7.064757160647572,
+ "grad_norm": 0.35613498091697693,
+ "learning_rate": 5.4456361758874235e-05,
+ "loss": 0.07551313638687134,
+ "mean_token_accuracy": 0.9739301167428493,
+ "num_tokens": 6627672.0,
+ "step": 2840
+ },
+ {
+ "epoch": 7.064757160647572,
+ "eval_entropy": 0.25941789089593775,
+ "eval_loss": 0.8209511637687683,
+ "eval_mean_token_accuracy": 0.8505055855873019,
+ "eval_num_tokens": 6627672.0,
+ "eval_runtime": 86.0943,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 2840
+ },
+ {
+ "entropy": 0.13500106502324344,
+ "epoch": 7.114570361145703,
+ "grad_norm": 0.34418627619743347,
+ "learning_rate": 5.2785422495482234e-05,
+ "loss": 0.07293946146965027,
+ "mean_token_accuracy": 0.9747208289802074,
+ "num_tokens": 6672946.0,
+ "step": 2860
+ },
+ {
+ "epoch": 7.114570361145703,
+ "eval_entropy": 0.26482899772912954,
+ "eval_loss": 0.798904538154602,
+ "eval_mean_token_accuracy": 0.8511530233677044,
+ "eval_num_tokens": 6672946.0,
+ "eval_runtime": 85.7915,
+ "eval_samples_per_second": 16.027,
+ "eval_steps_per_second": 2.005,
+ "step": 2860
+ },
+ {
+ "entropy": 0.13127502552233636,
+ "epoch": 7.164383561643835,
+ "grad_norm": 0.4638441503047943,
+ "learning_rate": 5.113268526757892e-05,
+ "loss": 0.07121461629867554,
+ "mean_token_accuracy": 0.9756786689162255,
+ "num_tokens": 6718582.0,
+ "step": 2880
+ },
+ {
+ "epoch": 7.164383561643835,
+ "eval_entropy": 0.2645381211714689,
+ "eval_loss": 0.809101939201355,
+ "eval_mean_token_accuracy": 0.8514727898115335,
+ "eval_num_tokens": 6718582.0,
+ "eval_runtime": 85.84,
+ "eval_samples_per_second": 16.018,
+ "eval_steps_per_second": 2.004,
+ "step": 2880
+ },
+ {
+ "entropy": 0.1331390908919275,
+ "epoch": 7.214196762141968,
+ "grad_norm": 0.40206775069236755,
+ "learning_rate": 4.949864851817007e-05,
+ "loss": 0.07188264131546021,
+ "mean_token_accuracy": 0.9755406074225903,
+ "num_tokens": 6764387.0,
+ "step": 2900
+ },
+ {
+ "epoch": 7.214196762141968,
+ "eval_entropy": 0.26244733283339544,
+ "eval_loss": 0.8143188953399658,
+ "eval_mean_token_accuracy": 0.8514358189909957,
+ "eval_num_tokens": 6764387.0,
+ "eval_runtime": 85.8546,
+ "eval_samples_per_second": 16.015,
+ "eval_steps_per_second": 2.003,
+ "step": 2900
+ },
+ {
+ "entropy": 0.13647331558167936,
+ "epoch": 7.2640099626401,
+ "grad_norm": 0.26405787467956543,
+ "learning_rate": 4.788380505045224e-05,
+ "loss": 0.07412450313568116,
+ "mean_token_accuracy": 0.9744274213910102,
+ "num_tokens": 6809678.0,
+ "step": 2920
+ },
+ {
+ "epoch": 7.2640099626401,
+ "eval_entropy": 0.2626111418182074,
+ "eval_loss": 0.8111525177955627,
+ "eval_mean_token_accuracy": 0.8512121695418691,
+ "eval_num_tokens": 6809678.0,
+ "eval_runtime": 85.9626,
+ "eval_samples_per_second": 15.995,
+ "eval_steps_per_second": 2.001,
+ "step": 2920
+ },
+ {
+ "entropy": 0.12644002586603165,
+ "epoch": 7.313823163138232,
+ "grad_norm": 0.27514681220054626,
+ "learning_rate": 4.6288641879189884e-05,
+ "loss": 0.06807711124420165,
+ "mean_token_accuracy": 0.9760703906416893,
+ "num_tokens": 6860750.0,
+ "step": 2940
+ },
+ {
+ "epoch": 7.313823163138232,
+ "eval_entropy": 0.26096762734097106,
+ "eval_loss": 0.8184595108032227,
+ "eval_mean_token_accuracy": 0.8501476153384807,
+ "eval_num_tokens": 6860750.0,
+ "eval_runtime": 85.9521,
+ "eval_samples_per_second": 15.997,
+ "eval_steps_per_second": 2.001,
+ "step": 2940
+ },
+ {
+ "entropy": 0.13920630998909472,
+ "epoch": 7.363636363636363,
+ "grad_norm": 0.23584705591201782,
+ "learning_rate": 4.4713640083838604e-05,
+ "loss": 0.07301607131958007,
+ "mean_token_accuracy": 0.9745715200901032,
+ "num_tokens": 6907092.0,
+ "step": 2960
+ },
+ {
+ "epoch": 7.363636363636363,
+ "eval_entropy": 0.2612536767021168,
+ "eval_loss": 0.8116245269775391,
+ "eval_mean_token_accuracy": 0.8510967350976412,
+ "eval_num_tokens": 6907092.0,
+ "eval_runtime": 85.6373,
+ "eval_samples_per_second": 16.056,
+ "eval_steps_per_second": 2.008,
+ "step": 2960
+ },
+ {
+ "entropy": 0.1349492883309722,
+ "epoch": 7.4134495641344955,
+ "grad_norm": 0.24552719295024872,
+ "learning_rate": 4.315927466345791e-05,
+ "loss": 0.07397544980049134,
+ "mean_token_accuracy": 0.9745095103979111,
+ "num_tokens": 6952700.0,
+ "step": 2980
+ },
+ {
+ "epoch": 7.4134495641344955,
+ "eval_entropy": 0.25796533306670744,
+ "eval_loss": 0.8266491293907166,
+ "eval_mean_token_accuracy": 0.8511653857868772,
+ "eval_num_tokens": 6952700.0,
+ "eval_runtime": 85.7462,
+ "eval_samples_per_second": 16.036,
+ "eval_steps_per_second": 2.006,
+ "step": 2980
+ },
+ {
+ "entropy": 0.14479175000451505,
+ "epoch": 7.463262764632628,
+ "grad_norm": 0.2846072018146515,
+ "learning_rate": 4.162601439345814e-05,
+ "loss": 0.07544798254966736,
+ "mean_token_accuracy": 0.9727819666266442,
+ "num_tokens": 6996430.0,
+ "step": 3000
+ },
+ {
+ "epoch": 7.463262764632628,
+ "eval_entropy": 0.2584348309698493,
+ "eval_loss": 0.8253348469734192,
+ "eval_mean_token_accuracy": 0.8511569815319638,
+ "eval_num_tokens": 6996430.0,
+ "eval_runtime": 86.2984,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 3000
+ },
+ {
+ "entropy": 0.14114196319133043,
+ "epoch": 7.51307596513076,
+ "grad_norm": 0.407966285943985,
+ "learning_rate": 4.011432168422419e-05,
+ "loss": 0.0736398994922638,
+ "mean_token_accuracy": 0.9741654269397259,
+ "num_tokens": 7042038.0,
+ "step": 3020
+ },
+ {
+ "epoch": 7.51307596513076,
+ "eval_entropy": 0.25232676260693127,
+ "eval_loss": 0.8296052813529968,
+ "eval_mean_token_accuracy": 0.8523298349491385,
+ "eval_num_tokens": 7042038.0,
+ "eval_runtime": 85.8445,
+ "eval_samples_per_second": 16.017,
+ "eval_steps_per_second": 2.004,
+ "step": 3020
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.9698489261690675e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3040/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3040/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3040/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3040/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3040/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3040/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3040/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3040/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3040/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3040/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3040/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3040/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3040/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3040/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..dbfaec6ce638d4df807c6efcaa844e22912f72d4
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3040/trainer_state.json
@@ -0,0 +1,3226 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 7.562889165628892,
+ "eval_steps": 20,
+ "global_step": 3040,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ },
+ {
+ "entropy": 0.3193941755220294,
+ "epoch": 4.5280199252802,
+ "grad_norm": 0.8281906843185425,
+ "learning_rate": 0.0001509111761786888,
+ "loss": 0.23936262130737304,
+ "mean_token_accuracy": 0.9201708927750587,
+ "num_tokens": 4244423.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.5280199252802,
+ "eval_entropy": 0.38704028864239537,
+ "eval_loss": 0.6006569266319275,
+ "eval_mean_token_accuracy": 0.8502406720505205,
+ "eval_num_tokens": 4244423.0,
+ "eval_runtime": 86.8059,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1820
+ },
+ {
+ "entropy": 0.3164879363030195,
+ "epoch": 4.577833125778331,
+ "grad_norm": 0.7892968654632568,
+ "learning_rate": 0.00014905346557909867,
+ "loss": 0.24541733264923096,
+ "mean_token_accuracy": 0.9175932116806507,
+ "num_tokens": 4289773.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.577833125778331,
+ "eval_entropy": 0.38861122120951497,
+ "eval_loss": 0.6115967631340027,
+ "eval_mean_token_accuracy": 0.849471275196519,
+ "eval_num_tokens": 4289773.0,
+ "eval_runtime": 86.2946,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1840
+ },
+ {
+ "entropy": 0.3051785985007882,
+ "epoch": 4.627646326276463,
+ "grad_norm": 0.8109654188156128,
+ "learning_rate": 0.0001471849238862319,
+ "loss": 0.23433220386505127,
+ "mean_token_accuracy": 0.9206570319831371,
+ "num_tokens": 4336894.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.627646326276463,
+ "eval_entropy": 0.37162452295076015,
+ "eval_loss": 0.6184061765670776,
+ "eval_mean_token_accuracy": 0.8501173268223918,
+ "eval_num_tokens": 4336894.0,
+ "eval_runtime": 86.6865,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1860
+ },
+ {
+ "entropy": 0.3168198253959417,
+ "epoch": 4.677459526774595,
+ "grad_norm": 0.9512342214584351,
+ "learning_rate": 0.0001453061146267775,
+ "loss": 0.23832404613494873,
+ "mean_token_accuracy": 0.9197044663131237,
+ "num_tokens": 4382947.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.677459526774595,
+ "eval_entropy": 0.3845940856912801,
+ "eval_loss": 0.606762707233429,
+ "eval_mean_token_accuracy": 0.8504838194957999,
+ "eval_num_tokens": 4382947.0,
+ "eval_runtime": 86.5175,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 1880
+ },
+ {
+ "entropy": 0.30791807882487776,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 0.8123113512992859,
+ "learning_rate": 0.00014341760442398248,
+ "loss": 0.2395785331726074,
+ "mean_token_accuracy": 0.918928150832653,
+ "num_tokens": 4433050.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.7272727272727275,
+ "eval_entropy": 0.39762327222283494,
+ "eval_loss": 0.5994202494621277,
+ "eval_mean_token_accuracy": 0.8509274201337681,
+ "eval_num_tokens": 4433050.0,
+ "eval_runtime": 86.2873,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.993,
+ "step": 1900
+ },
+ {
+ "entropy": 0.3021434534341097,
+ "epoch": 4.777085927770859,
+ "grad_norm": 0.731787383556366,
+ "learning_rate": 0.000141519962826766,
+ "loss": 0.23494718074798585,
+ "mean_token_accuracy": 0.9201403826475143,
+ "num_tokens": 4483598.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.777085927770859,
+ "eval_entropy": 0.3827026732439219,
+ "eval_loss": 0.5995895862579346,
+ "eval_mean_token_accuracy": 0.851468373523202,
+ "eval_num_tokens": 4483598.0,
+ "eval_runtime": 86.3006,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 1920
+ },
+ {
+ "entropy": 0.31626159623265265,
+ "epoch": 4.826899128268991,
+ "grad_norm": 0.8848487138748169,
+ "learning_rate": 0.00013961376213795132,
+ "loss": 0.2439030647277832,
+ "mean_token_accuracy": 0.9196575872600079,
+ "num_tokens": 4529201.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.826899128268991,
+ "eval_entropy": 0.388698436839636,
+ "eval_loss": 0.6000174283981323,
+ "eval_mean_token_accuracy": 0.8518068187458571,
+ "eval_num_tokens": 4529201.0,
+ "eval_runtime": 86.8979,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.979,
+ "step": 1940
+ },
+ {
+ "entropy": 0.30520407035946845,
+ "epoch": 4.876712328767123,
+ "grad_norm": 0.8532460927963257,
+ "learning_rate": 0.00013769957724166695,
+ "loss": 0.23458616733551024,
+ "mean_token_accuracy": 0.9221912942826748,
+ "num_tokens": 4578167.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.876712328767123,
+ "eval_entropy": 0.38777847102908203,
+ "eval_loss": 0.6004981398582458,
+ "eval_mean_token_accuracy": 0.8516481768253238,
+ "eval_num_tokens": 4578167.0,
+ "eval_runtime": 87.0777,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.975,
+ "step": 1960
+ },
+ {
+ "entropy": 0.3226448342204094,
+ "epoch": 4.926525529265255,
+ "grad_norm": 0.6945561766624451,
+ "learning_rate": 0.0001357779854299694,
+ "loss": 0.24048397541046143,
+ "mean_token_accuracy": 0.9195300146937371,
+ "num_tokens": 4622316.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.926525529265255,
+ "eval_entropy": 0.38581624263247777,
+ "eval_loss": 0.6029234528541565,
+ "eval_mean_token_accuracy": 0.8514213260523108,
+ "eval_num_tokens": 4622316.0,
+ "eval_runtime": 85.8729,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 1980
+ },
+ {
+ "entropy": 0.3051655298098922,
+ "epoch": 4.976338729763388,
+ "grad_norm": 0.7976452708244324,
+ "learning_rate": 0.00013384956622874001,
+ "loss": 0.23584742546081544,
+ "mean_token_accuracy": 0.9216851457953453,
+ "num_tokens": 4670746.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.976338729763388,
+ "eval_entropy": 0.37913159246361533,
+ "eval_loss": 0.6057604551315308,
+ "eval_mean_token_accuracy": 0.8525801203971686,
+ "eval_num_tokens": 4670746.0,
+ "eval_runtime": 86.1145,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2000
+ },
+ {
+ "entropy": 0.27438195240803254,
+ "epoch": 5.024906600249066,
+ "grad_norm": 0.6729586124420166,
+ "learning_rate": 0.0001319149012229075,
+ "loss": 0.19775952100753785,
+ "mean_token_accuracy": 0.9339428559327737,
+ "num_tokens": 4716176.0,
+ "step": 2020
+ },
+ {
+ "epoch": 5.024906600249066,
+ "eval_entropy": 0.3448961910813354,
+ "eval_loss": 0.6750120520591736,
+ "eval_mean_token_accuracy": 0.8487970232963562,
+ "eval_num_tokens": 4716176.0,
+ "eval_runtime": 86.1169,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2020
+ },
+ {
+ "entropy": 0.21423916313797237,
+ "epoch": 5.074719800747198,
+ "grad_norm": 0.6934391856193542,
+ "learning_rate": 0.00012997457388105022,
+ "loss": 0.1439570426940918,
+ "mean_token_accuracy": 0.9528236843645572,
+ "num_tokens": 4763269.0,
+ "step": 2040
+ },
+ {
+ "epoch": 5.074719800747198,
+ "eval_entropy": 0.3570949243771475,
+ "eval_loss": 0.6465504169464111,
+ "eval_mean_token_accuracy": 0.8490785547467166,
+ "eval_num_tokens": 4763269.0,
+ "eval_runtime": 85.9574,
+ "eval_samples_per_second": 15.996,
+ "eval_steps_per_second": 2.001,
+ "step": 2040
+ },
+ {
+ "entropy": 0.20838565267622472,
+ "epoch": 5.12453300124533,
+ "grad_norm": 0.7286986112594604,
+ "learning_rate": 0.00012802916937942972,
+ "loss": 0.14467307329177856,
+ "mean_token_accuracy": 0.950994835793972,
+ "num_tokens": 4809047.0,
+ "step": 2060
+ },
+ {
+ "epoch": 5.12453300124533,
+ "eval_entropy": 0.3452463157821533,
+ "eval_loss": 0.6705958843231201,
+ "eval_mean_token_accuracy": 0.8490352796953778,
+ "eval_num_tokens": 4809047.0,
+ "eval_runtime": 86.228,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 2060
+ },
+ {
+ "entropy": 0.20453082229942082,
+ "epoch": 5.174346201743462,
+ "grad_norm": 0.7515555620193481,
+ "learning_rate": 0.00012607927442550974,
+ "loss": 0.13732000589370727,
+ "mean_token_accuracy": 0.9537357829511166,
+ "num_tokens": 4857965.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.174346201743462,
+ "eval_entropy": 0.32431264914745506,
+ "eval_loss": 0.6743043065071106,
+ "eval_mean_token_accuracy": 0.8504878629085629,
+ "eval_num_tokens": 4857965.0,
+ "eval_runtime": 86.5948,
+ "eval_samples_per_second": 15.879,
+ "eval_steps_per_second": 1.986,
+ "step": 2080
+ },
+ {
+ "entropy": 0.21812320686876774,
+ "epoch": 5.224159402241594,
+ "grad_norm": 0.9093465209007263,
+ "learning_rate": 0.0001241254770810132,
+ "loss": 0.14311420917510986,
+ "mean_token_accuracy": 0.9514068141579628,
+ "num_tokens": 4905151.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.224159402241594,
+ "eval_entropy": 0.33086285835435225,
+ "eval_loss": 0.6676449179649353,
+ "eval_mean_token_accuracy": 0.8505287662495015,
+ "eval_num_tokens": 4905151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 2100
+ },
+ {
+ "entropy": 0.2180163251236081,
+ "epoch": 5.273972602739726,
+ "grad_norm": 0.6703007221221924,
+ "learning_rate": 0.00012216836658457075,
+ "loss": 0.14803968667984008,
+ "mean_token_accuracy": 0.9521303348243236,
+ "num_tokens": 4947072.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.273972602739726,
+ "eval_entropy": 0.33162341708707255,
+ "eval_loss": 0.6658875942230225,
+ "eval_mean_token_accuracy": 0.8500757605530495,
+ "eval_num_tokens": 4947072.0,
+ "eval_runtime": 86.6296,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 2120
+ },
+ {
+ "entropy": 0.22511130161583423,
+ "epoch": 5.323785803237858,
+ "grad_norm": 0.8078880906105042,
+ "learning_rate": 0.00012020853317401455,
+ "loss": 0.15228408575057983,
+ "mean_token_accuracy": 0.947144789993763,
+ "num_tokens": 4991974.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.323785803237858,
+ "eval_entropy": 0.3354601170434508,
+ "eval_loss": 0.6677829623222351,
+ "eval_mean_token_accuracy": 0.8482600024273229,
+ "eval_num_tokens": 4991974.0,
+ "eval_runtime": 86.4689,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.989,
+ "step": 2140
+ },
+ {
+ "entropy": 0.2244176059961319,
+ "epoch": 5.37359900373599,
+ "grad_norm": 0.9636075496673584,
+ "learning_rate": 0.00011824656790837037,
+ "loss": 0.15260883569717407,
+ "mean_token_accuracy": 0.9471467643976211,
+ "num_tokens": 5038400.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.37359900373599,
+ "eval_entropy": 0.3381616926297199,
+ "eval_loss": 0.6694412231445312,
+ "eval_mean_token_accuracy": 0.8482369603805764,
+ "eval_num_tokens": 5038400.0,
+ "eval_runtime": 86.4147,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 2160
+ },
+ {
+ "entropy": 0.22982364390045404,
+ "epoch": 5.423412204234122,
+ "grad_norm": 0.775401771068573,
+ "learning_rate": 0.00011628306248960262,
+ "loss": 0.15140302181243898,
+ "mean_token_accuracy": 0.9492553934454918,
+ "num_tokens": 5083166.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.423412204234122,
+ "eval_entropy": 0.3305150235808173,
+ "eval_loss": 0.6717822551727295,
+ "eval_mean_token_accuracy": 0.8489849723355715,
+ "eval_num_tokens": 5083166.0,
+ "eval_runtime": 86.4728,
+ "eval_samples_per_second": 15.901,
+ "eval_steps_per_second": 1.989,
+ "step": 2180
+ },
+ {
+ "entropy": 0.21448935717344284,
+ "epoch": 5.473225404732254,
+ "grad_norm": 0.6575281023979187,
+ "learning_rate": 0.00011431860908416465,
+ "loss": 0.1452319622039795,
+ "mean_token_accuracy": 0.9505287684500218,
+ "num_tokens": 5135109.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.473225404732254,
+ "eval_entropy": 0.3488145174328671,
+ "eval_loss": 0.6612305641174316,
+ "eval_mean_token_accuracy": 0.8492907808963642,
+ "eval_num_tokens": 5135109.0,
+ "eval_runtime": 86.6927,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 2200
+ },
+ {
+ "entropy": 0.23091202937066554,
+ "epoch": 5.523038605230386,
+ "grad_norm": 0.8909686207771301,
+ "learning_rate": 0.00011235380014440985,
+ "loss": 0.15150139331817628,
+ "mean_token_accuracy": 0.9497875183820724,
+ "num_tokens": 5180138.0,
+ "step": 2220
+ },
+ {
+ "epoch": 5.523038605230386,
+ "eval_entropy": 0.3268539015810157,
+ "eval_loss": 0.6667542457580566,
+ "eval_mean_token_accuracy": 0.8499062903398691,
+ "eval_num_tokens": 5180138.0,
+ "eval_runtime": 86.4644,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 2220
+ },
+ {
+ "entropy": 0.2227974807843566,
+ "epoch": 5.572851805728518,
+ "grad_norm": 0.6180275082588196,
+ "learning_rate": 0.0001103892282299158,
+ "loss": 0.1491069197654724,
+ "mean_token_accuracy": 0.9488144010305405,
+ "num_tokens": 5226864.0,
+ "step": 2240
+ },
+ {
+ "epoch": 5.572851805728518,
+ "eval_entropy": 0.3346347655494546,
+ "eval_loss": 0.6665948629379272,
+ "eval_mean_token_accuracy": 0.8499961893918903,
+ "eval_num_tokens": 5226864.0,
+ "eval_runtime": 87.0548,
+ "eval_samples_per_second": 15.795,
+ "eval_steps_per_second": 1.976,
+ "step": 2240
+ },
+ {
+ "entropy": 0.21368421968072654,
+ "epoch": 5.62266500622665,
+ "grad_norm": 0.6004369258880615,
+ "learning_rate": 0.00010842548582877651,
+ "loss": 0.14485255479812623,
+ "mean_token_accuracy": 0.9502056457102299,
+ "num_tokens": 5276602.0,
+ "step": 2260
+ },
+ {
+ "epoch": 5.62266500622665,
+ "eval_entropy": 0.32753298804163933,
+ "eval_loss": 0.6680151224136353,
+ "eval_mean_token_accuracy": 0.8515451086121936,
+ "eval_num_tokens": 5276602.0,
+ "eval_runtime": 86.8524,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.98,
+ "step": 2260
+ },
+ {
+ "entropy": 0.2103635374456644,
+ "epoch": 5.672478206724782,
+ "grad_norm": 0.699174702167511,
+ "learning_rate": 0.00010646316517891613,
+ "loss": 0.14297772645950318,
+ "mean_token_accuracy": 0.9512537539005279,
+ "num_tokens": 5323718.0,
+ "step": 2280
+ },
+ {
+ "epoch": 5.672478206724782,
+ "eval_entropy": 0.32966585959806,
+ "eval_loss": 0.675578773021698,
+ "eval_mean_token_accuracy": 0.8509623023659684,
+ "eval_num_tokens": 5323718.0,
+ "eval_runtime": 86.4518,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2280
+ },
+ {
+ "entropy": 0.22516900151968003,
+ "epoch": 5.722291407222914,
+ "grad_norm": 0.6637354493141174,
+ "learning_rate": 0.00010450285808947797,
+ "loss": 0.15202572345733642,
+ "mean_token_accuracy": 0.9482452072203159,
+ "num_tokens": 5369039.0,
+ "step": 2300
+ },
+ {
+ "epoch": 5.722291407222914,
+ "eval_entropy": 0.3369456917740578,
+ "eval_loss": 0.6697061061859131,
+ "eval_mean_token_accuracy": 0.848603522361711,
+ "eval_num_tokens": 5369039.0,
+ "eval_runtime": 86.6371,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.985,
+ "step": 2300
+ },
+ {
+ "entropy": 0.21841065725311637,
+ "epoch": 5.772104607721046,
+ "grad_norm": 0.7940268516540527,
+ "learning_rate": 0.00010254515576234297,
+ "loss": 0.14710167646408082,
+ "mean_token_accuracy": 0.9493498183786869,
+ "num_tokens": 5417029.0,
+ "step": 2320
+ },
+ {
+ "epoch": 5.772104607721046,
+ "eval_entropy": 0.3237486180177955,
+ "eval_loss": 0.6779657602310181,
+ "eval_mean_token_accuracy": 0.8500715313955794,
+ "eval_num_tokens": 5417029.0,
+ "eval_runtime": 86.1826,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 1.996,
+ "step": 2320
+ },
+ {
+ "entropy": 0.22146204356104135,
+ "epoch": 5.821917808219178,
+ "grad_norm": 0.9234833121299744,
+ "learning_rate": 0.00010059064861383132,
+ "loss": 0.14720046520233154,
+ "mean_token_accuracy": 0.9493872679769992,
+ "num_tokens": 5461671.0,
+ "step": 2340
+ },
+ {
+ "epoch": 5.821917808219178,
+ "eval_entropy": 0.32365207564692167,
+ "eval_loss": 0.6704005002975464,
+ "eval_mean_token_accuracy": 0.8507985760306203,
+ "eval_num_tokens": 5461671.0,
+ "eval_runtime": 86.5494,
+ "eval_samples_per_second": 15.887,
+ "eval_steps_per_second": 1.987,
+ "step": 2340
+ },
+ {
+ "entropy": 0.20934011954814197,
+ "epoch": 5.87173100871731,
+ "grad_norm": 0.5547503232955933,
+ "learning_rate": 9.863992609664084e-05,
+ "loss": 0.1464867353439331,
+ "mean_token_accuracy": 0.9503875687718392,
+ "num_tokens": 5509312.0,
+ "step": 2360
+ },
+ {
+ "epoch": 5.87173100871731,
+ "eval_entropy": 0.3330401429083458,
+ "eval_loss": 0.6659091114997864,
+ "eval_mean_token_accuracy": 0.8504848906467127,
+ "eval_num_tokens": 5509312.0,
+ "eval_runtime": 86.5855,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 2360
+ },
+ {
+ "entropy": 0.21678635366261007,
+ "epoch": 5.921544209215442,
+ "grad_norm": 0.570612907409668,
+ "learning_rate": 9.669357652207635e-05,
+ "loss": 0.14821385145187377,
+ "mean_token_accuracy": 0.9503940217196941,
+ "num_tokens": 5558196.0,
+ "step": 2380
+ },
+ {
+ "epoch": 5.921544209215442,
+ "eval_entropy": 0.3322022325077722,
+ "eval_loss": 0.6722489595413208,
+ "eval_mean_token_accuracy": 0.8489979422369669,
+ "eval_num_tokens": 5558196.0,
+ "eval_runtime": 86.2986,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 2380
+ },
+ {
+ "entropy": 0.20932920072227718,
+ "epoch": 5.971357409713574,
+ "grad_norm": 0.7879557609558105,
+ "learning_rate": 9.475218688262262e-05,
+ "loss": 0.14675841331481934,
+ "mean_token_accuracy": 0.9507176131010056,
+ "num_tokens": 5605400.0,
+ "step": 2400
+ },
+ {
+ "epoch": 5.971357409713574,
+ "eval_entropy": 0.3199348642902319,
+ "eval_loss": 0.6698136329650879,
+ "eval_mean_token_accuracy": 0.8514142130003419,
+ "eval_num_tokens": 5605400.0,
+ "eval_runtime": 85.8995,
+ "eval_samples_per_second": 16.007,
+ "eval_steps_per_second": 2.002,
+ "step": 2400
+ },
+ {
+ "entropy": 0.21032143919131693,
+ "epoch": 6.019925280199253,
+ "grad_norm": 0.5823076367378235,
+ "learning_rate": 9.281634267491569e-05,
+ "loss": 0.13322267532348633,
+ "mean_token_accuracy": 0.9550939072401096,
+ "num_tokens": 5648968.0,
+ "step": 2420
+ },
+ {
+ "epoch": 6.019925280199253,
+ "eval_entropy": 0.30206270117399303,
+ "eval_loss": 0.7093168497085571,
+ "eval_mean_token_accuracy": 0.8500627639681794,
+ "eval_num_tokens": 5648968.0,
+ "eval_runtime": 85.8128,
+ "eval_samples_per_second": 16.023,
+ "eval_steps_per_second": 2.004,
+ "step": 2420
+ },
+ {
+ "entropy": 0.1534628233872354,
+ "epoch": 6.069738480697385,
+ "grad_norm": 0.710133969783783,
+ "learning_rate": 9.088662772316508e-05,
+ "loss": 0.09078952670097351,
+ "mean_token_accuracy": 0.9678447999060154,
+ "num_tokens": 5697633.0,
+ "step": 2440
+ },
+ {
+ "epoch": 6.069738480697385,
+ "eval_entropy": 0.28208133101809857,
+ "eval_loss": 0.7636417150497437,
+ "eval_mean_token_accuracy": 0.8494061477655588,
+ "eval_num_tokens": 5697633.0,
+ "eval_runtime": 85.9724,
+ "eval_samples_per_second": 15.994,
+ "eval_steps_per_second": 2.001,
+ "step": 2440
+ },
+ {
+ "entropy": 0.16151462448760867,
+ "epoch": 6.119551681195516,
+ "grad_norm": 0.5793812274932861,
+ "learning_rate": 8.896362400308028e-05,
+ "loss": 0.09545697569847107,
+ "mean_token_accuracy": 0.9671573750674725,
+ "num_tokens": 5745090.0,
+ "step": 2460
+ },
+ {
+ "epoch": 6.119551681195516,
+ "eval_entropy": 0.2833245605403601,
+ "eval_loss": 0.7402405738830566,
+ "eval_mean_token_accuracy": 0.8503523728875226,
+ "eval_num_tokens": 5745090.0,
+ "eval_runtime": 85.5461,
+ "eval_samples_per_second": 16.073,
+ "eval_steps_per_second": 2.011,
+ "step": 2460
+ },
+ {
+ "entropy": 0.15203177919611335,
+ "epoch": 6.169364881693649,
+ "grad_norm": 0.4251123368740082,
+ "learning_rate": 8.704791146635483e-05,
+ "loss": 0.09420782327651978,
+ "mean_token_accuracy": 0.9677386932075024,
+ "num_tokens": 5790333.0,
+ "step": 2480
+ },
+ {
+ "epoch": 6.169364881693649,
+ "eval_entropy": 0.28572545962971313,
+ "eval_loss": 0.735416829586029,
+ "eval_mean_token_accuracy": 0.8487084663884584,
+ "eval_num_tokens": 5790333.0,
+ "eval_runtime": 85.4801,
+ "eval_samples_per_second": 16.086,
+ "eval_steps_per_second": 2.012,
+ "step": 2480
+ },
+ {
+ "entropy": 0.15587336672469973,
+ "epoch": 6.219178082191781,
+ "grad_norm": 0.4357028007507324,
+ "learning_rate": 8.514006786576085e-05,
+ "loss": 0.09429320096969604,
+ "mean_token_accuracy": 0.9682952925562859,
+ "num_tokens": 5837321.0,
+ "step": 2500
+ },
+ {
+ "epoch": 6.219178082191781,
+ "eval_entropy": 0.2859006894882335,
+ "eval_loss": 0.7347224950790405,
+ "eval_mean_token_accuracy": 0.8501905518215757,
+ "eval_num_tokens": 5837321.0,
+ "eval_runtime": 85.7578,
+ "eval_samples_per_second": 16.034,
+ "eval_steps_per_second": 2.006,
+ "step": 2500
+ },
+ {
+ "entropy": 0.15765639198943973,
+ "epoch": 6.268991282689913,
+ "grad_norm": 0.47331130504608154,
+ "learning_rate": 8.324066858090663e-05,
+ "loss": 0.09571113586425781,
+ "mean_token_accuracy": 0.9683481335639954,
+ "num_tokens": 5884398.0,
+ "step": 2520
+ },
+ {
+ "epoch": 6.268991282689913,
+ "eval_entropy": 0.29231513846059176,
+ "eval_loss": 0.7392512559890747,
+ "eval_mean_token_accuracy": 0.8486633983462356,
+ "eval_num_tokens": 5884398.0,
+ "eval_runtime": 85.7846,
+ "eval_samples_per_second": 16.029,
+ "eval_steps_per_second": 2.005,
+ "step": 2520
+ },
+ {
+ "entropy": 0.16176860257983208,
+ "epoch": 6.318804483188045,
+ "grad_norm": 0.6142018437385559,
+ "learning_rate": 8.135028644470992e-05,
+ "loss": 0.09486144185066223,
+ "mean_token_accuracy": 0.9682316601276397,
+ "num_tokens": 5929876.0,
+ "step": 2540
+ },
+ {
+ "epoch": 6.318804483188045,
+ "eval_entropy": 0.2851274753379267,
+ "eval_loss": 0.7520816922187805,
+ "eval_mean_token_accuracy": 0.8501113649717597,
+ "eval_num_tokens": 5929876.0,
+ "eval_runtime": 85.9425,
+ "eval_samples_per_second": 15.999,
+ "eval_steps_per_second": 2.001,
+ "step": 2540
+ },
+ {
+ "entropy": 0.15404034564271568,
+ "epoch": 6.3686176836861765,
+ "grad_norm": 0.6051287651062012,
+ "learning_rate": 7.946949157063964e-05,
+ "loss": 0.09280472993850708,
+ "mean_token_accuracy": 0.9684635892510414,
+ "num_tokens": 5978490.0,
+ "step": 2560
+ },
+ {
+ "epoch": 6.3686176836861765,
+ "eval_entropy": 0.28802703563557114,
+ "eval_loss": 0.7439162135124207,
+ "eval_mean_token_accuracy": 0.8499851770872293,
+ "eval_num_tokens": 5978490.0,
+ "eval_runtime": 86.0703,
+ "eval_samples_per_second": 15.975,
+ "eval_steps_per_second": 1.998,
+ "step": 2560
+ },
+ {
+ "entropy": 0.15343588953837753,
+ "epoch": 6.418430884184309,
+ "grad_norm": 0.4823743402957916,
+ "learning_rate": 7.759885118077701e-05,
+ "loss": 0.09000591039657593,
+ "mean_token_accuracy": 0.9699928767979145,
+ "num_tokens": 6025380.0,
+ "step": 2580
+ },
+ {
+ "epoch": 6.418430884184309,
+ "eval_entropy": 0.2795634938533916,
+ "eval_loss": 0.7647850513458252,
+ "eval_mean_token_accuracy": 0.8503464397995971,
+ "eval_num_tokens": 6025380.0,
+ "eval_runtime": 85.8886,
+ "eval_samples_per_second": 16.009,
+ "eval_steps_per_second": 2.003,
+ "step": 2580
+ },
+ {
+ "entropy": 0.15740026142448188,
+ "epoch": 6.468244084682441,
+ "grad_norm": 0.5082696676254272,
+ "learning_rate": 7.57389294347494e-05,
+ "loss": 0.09191849827766418,
+ "mean_token_accuracy": 0.9692809768021107,
+ "num_tokens": 6073349.0,
+ "step": 2600
+ },
+ {
+ "epoch": 6.468244084682441,
+ "eval_entropy": 0.2913342311458532,
+ "eval_loss": 0.7518694996833801,
+ "eval_mean_token_accuracy": 0.8483168302580367,
+ "eval_num_tokens": 6073349.0,
+ "eval_runtime": 85.5761,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.01,
+ "step": 2600
+ },
+ {
+ "entropy": 0.15922069251537324,
+ "epoch": 6.518057285180573,
+ "grad_norm": 0.3995199501514435,
+ "learning_rate": 7.389028725958736e-05,
+ "loss": 0.09584367871284485,
+ "mean_token_accuracy": 0.9685114495456218,
+ "num_tokens": 6118148.0,
+ "step": 2620
+ },
+ {
+ "epoch": 6.518057285180573,
+ "eval_entropy": 0.2863075934177221,
+ "eval_loss": 0.7539381384849548,
+ "eval_mean_token_accuracy": 0.8507507083027862,
+ "eval_num_tokens": 6118148.0,
+ "eval_runtime": 86.112,
+ "eval_samples_per_second": 15.968,
+ "eval_steps_per_second": 1.997,
+ "step": 2620
+ },
+ {
+ "entropy": 0.16197575423866512,
+ "epoch": 6.567870485678705,
+ "grad_norm": 0.534295380115509,
+ "learning_rate": 7.205348218055678e-05,
+ "loss": 0.0961170256137848,
+ "mean_token_accuracy": 0.9674530044198036,
+ "num_tokens": 6165523.0,
+ "step": 2640
+ },
+ {
+ "epoch": 6.567870485678705,
+ "eval_entropy": 0.29021967315050057,
+ "eval_loss": 0.751198947429657,
+ "eval_mean_token_accuracy": 0.8509796344956686,
+ "eval_num_tokens": 6165523.0,
+ "eval_runtime": 85.7958,
+ "eval_samples_per_second": 16.026,
+ "eval_steps_per_second": 2.005,
+ "step": 2640
+ },
+ {
+ "entropy": 0.15261746793985367,
+ "epoch": 6.617683686176837,
+ "grad_norm": 0.5391237139701843,
+ "learning_rate": 7.022906815301673e-05,
+ "loss": 0.0926026999950409,
+ "mean_token_accuracy": 0.9695659473538398,
+ "num_tokens": 6216232.0,
+ "step": 2660
+ },
+ {
+ "epoch": 6.617683686176837,
+ "eval_entropy": 0.29128045216202736,
+ "eval_loss": 0.7450292110443115,
+ "eval_mean_token_accuracy": 0.8498771443616512,
+ "eval_num_tokens": 6216232.0,
+ "eval_runtime": 86.3963,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 2660
+ },
+ {
+ "entropy": 0.16164180357009172,
+ "epoch": 6.667496886674969,
+ "grad_norm": 0.5767946243286133,
+ "learning_rate": 6.841759539535419e-05,
+ "loss": 0.09291981458663941,
+ "mean_token_accuracy": 0.9687136687338352,
+ "num_tokens": 6264807.0,
+ "step": 2680
+ },
+ {
+ "epoch": 6.667496886674969,
+ "eval_entropy": 0.2897637223088464,
+ "eval_loss": 0.7503410577774048,
+ "eval_mean_token_accuracy": 0.8503315164599308,
+ "eval_num_tokens": 6264807.0,
+ "eval_runtime": 86.0653,
+ "eval_samples_per_second": 15.976,
+ "eval_steps_per_second": 1.998,
+ "step": 2680
+ },
+ {
+ "entropy": 0.17062523355707526,
+ "epoch": 6.717310087173101,
+ "grad_norm": 0.4974168539047241,
+ "learning_rate": 6.661961022304563e-05,
+ "loss": 0.09713236689567566,
+ "mean_token_accuracy": 0.9661971725523472,
+ "num_tokens": 6308819.0,
+ "step": 2700
+ },
+ {
+ "epoch": 6.717310087173101,
+ "eval_entropy": 0.2765843396963075,
+ "eval_loss": 0.7604002356529236,
+ "eval_mean_token_accuracy": 0.8521115277395692,
+ "eval_num_tokens": 6308819.0,
+ "eval_runtime": 86.1676,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 2700
+ },
+ {
+ "entropy": 0.17544092936441302,
+ "epoch": 6.767123287671232,
+ "grad_norm": 0.5523537993431091,
+ "learning_rate": 6.483565488389582e-05,
+ "loss": 0.09709116220474243,
+ "mean_token_accuracy": 0.9650957375764847,
+ "num_tokens": 6352548.0,
+ "step": 2720
+ },
+ {
+ "epoch": 6.767123287671232,
+ "eval_entropy": 0.27939334659035814,
+ "eval_loss": 0.7534670829772949,
+ "eval_mean_token_accuracy": 0.851230604010959,
+ "eval_num_tokens": 6352548.0,
+ "eval_runtime": 86.2913,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 2720
+ },
+ {
+ "entropy": 0.15991022661328316,
+ "epoch": 6.816936488169365,
+ "grad_norm": 0.478551983833313,
+ "learning_rate": 6.306626739450311e-05,
+ "loss": 0.09564646482467651,
+ "mean_token_accuracy": 0.9679084822535515,
+ "num_tokens": 6397720.0,
+ "step": 2740
+ },
+ {
+ "epoch": 6.816936488169365,
+ "eval_entropy": 0.27878295491601146,
+ "eval_loss": 0.7519959211349487,
+ "eval_mean_token_accuracy": 0.8510654949864676,
+ "eval_num_tokens": 6397720.0,
+ "eval_runtime": 85.9109,
+ "eval_samples_per_second": 16.005,
+ "eval_steps_per_second": 2.002,
+ "step": 2740
+ },
+ {
+ "entropy": 0.16824879590421915,
+ "epoch": 6.866749688667497,
+ "grad_norm": 0.6681098937988281,
+ "learning_rate": 6.131198137800108e-05,
+ "loss": 0.0962279736995697,
+ "mean_token_accuracy": 0.966830012947321,
+ "num_tokens": 6442821.0,
+ "step": 2760
+ },
+ {
+ "epoch": 6.866749688667497,
+ "eval_entropy": 0.2834690434121808,
+ "eval_loss": 0.751922070980072,
+ "eval_mean_token_accuracy": 0.8521237577809844,
+ "eval_num_tokens": 6442821.0,
+ "eval_runtime": 86.3618,
+ "eval_samples_per_second": 15.921,
+ "eval_steps_per_second": 1.992,
+ "step": 2760
+ },
+ {
+ "entropy": 0.1518704930320382,
+ "epoch": 6.916562889165629,
+ "grad_norm": 0.5201290249824524,
+ "learning_rate": 5.957332590312513e-05,
+ "loss": 0.09010660648345947,
+ "mean_token_accuracy": 0.9693463340401649,
+ "num_tokens": 6494118.0,
+ "step": 2780
+ },
+ {
+ "epoch": 6.916562889165629,
+ "eval_entropy": 0.28485129617674404,
+ "eval_loss": 0.7452457547187805,
+ "eval_mean_token_accuracy": 0.8512036796919135,
+ "eval_num_tokens": 6494118.0,
+ "eval_runtime": 86.4524,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2780
+ },
+ {
+ "entropy": 0.15512610590085388,
+ "epoch": 6.966376089663761,
+ "grad_norm": 0.42802050709724426,
+ "learning_rate": 5.785082532465233e-05,
+ "loss": 0.09320432543754578,
+ "mean_token_accuracy": 0.9686134628951549,
+ "num_tokens": 6540175.0,
+ "step": 2800
+ },
+ {
+ "epoch": 6.966376089663761,
+ "eval_entropy": 0.27554594526110693,
+ "eval_loss": 0.7644653916358948,
+ "eval_mean_token_accuracy": 0.8513738523389018,
+ "eval_num_tokens": 6540175.0,
+ "eval_runtime": 85.7609,
+ "eval_samples_per_second": 16.033,
+ "eval_steps_per_second": 2.006,
+ "step": 2800
+ },
+ {
+ "entropy": 0.17524497526196334,
+ "epoch": 7.01494396014944,
+ "grad_norm": 0.3330269157886505,
+ "learning_rate": 5.6144999125263545e-05,
+ "loss": 0.0895616888999939,
+ "mean_token_accuracy": 0.9682766932707566,
+ "num_tokens": 6583767.0,
+ "step": 2820
+ },
+ {
+ "epoch": 7.01494396014944,
+ "eval_entropy": 0.2735865569218647,
+ "eval_loss": 0.768479585647583,
+ "eval_mean_token_accuracy": 0.8503459383581959,
+ "eval_num_tokens": 6583767.0,
+ "eval_runtime": 85.7162,
+ "eval_samples_per_second": 16.041,
+ "eval_steps_per_second": 2.007,
+ "step": 2820
+ },
+ {
+ "entropy": 0.1403565663844347,
+ "epoch": 7.064757160647572,
+ "grad_norm": 0.35613498091697693,
+ "learning_rate": 5.4456361758874235e-05,
+ "loss": 0.07551313638687134,
+ "mean_token_accuracy": 0.9739301167428493,
+ "num_tokens": 6627672.0,
+ "step": 2840
+ },
+ {
+ "epoch": 7.064757160647572,
+ "eval_entropy": 0.25941789089593775,
+ "eval_loss": 0.8209511637687683,
+ "eval_mean_token_accuracy": 0.8505055855873019,
+ "eval_num_tokens": 6627672.0,
+ "eval_runtime": 86.0943,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 2840
+ },
+ {
+ "entropy": 0.13500106502324344,
+ "epoch": 7.114570361145703,
+ "grad_norm": 0.34418627619743347,
+ "learning_rate": 5.2785422495482234e-05,
+ "loss": 0.07293946146965027,
+ "mean_token_accuracy": 0.9747208289802074,
+ "num_tokens": 6672946.0,
+ "step": 2860
+ },
+ {
+ "epoch": 7.114570361145703,
+ "eval_entropy": 0.26482899772912954,
+ "eval_loss": 0.798904538154602,
+ "eval_mean_token_accuracy": 0.8511530233677044,
+ "eval_num_tokens": 6672946.0,
+ "eval_runtime": 85.7915,
+ "eval_samples_per_second": 16.027,
+ "eval_steps_per_second": 2.005,
+ "step": 2860
+ },
+ {
+ "entropy": 0.13127502552233636,
+ "epoch": 7.164383561643835,
+ "grad_norm": 0.4638441503047943,
+ "learning_rate": 5.113268526757892e-05,
+ "loss": 0.07121461629867554,
+ "mean_token_accuracy": 0.9756786689162255,
+ "num_tokens": 6718582.0,
+ "step": 2880
+ },
+ {
+ "epoch": 7.164383561643835,
+ "eval_entropy": 0.2645381211714689,
+ "eval_loss": 0.809101939201355,
+ "eval_mean_token_accuracy": 0.8514727898115335,
+ "eval_num_tokens": 6718582.0,
+ "eval_runtime": 85.84,
+ "eval_samples_per_second": 16.018,
+ "eval_steps_per_second": 2.004,
+ "step": 2880
+ },
+ {
+ "entropy": 0.1331390908919275,
+ "epoch": 7.214196762141968,
+ "grad_norm": 0.40206775069236755,
+ "learning_rate": 4.949864851817007e-05,
+ "loss": 0.07188264131546021,
+ "mean_token_accuracy": 0.9755406074225903,
+ "num_tokens": 6764387.0,
+ "step": 2900
+ },
+ {
+ "epoch": 7.214196762141968,
+ "eval_entropy": 0.26244733283339544,
+ "eval_loss": 0.8143188953399658,
+ "eval_mean_token_accuracy": 0.8514358189909957,
+ "eval_num_tokens": 6764387.0,
+ "eval_runtime": 85.8546,
+ "eval_samples_per_second": 16.015,
+ "eval_steps_per_second": 2.003,
+ "step": 2900
+ },
+ {
+ "entropy": 0.13647331558167936,
+ "epoch": 7.2640099626401,
+ "grad_norm": 0.26405787467956543,
+ "learning_rate": 4.788380505045224e-05,
+ "loss": 0.07412450313568116,
+ "mean_token_accuracy": 0.9744274213910102,
+ "num_tokens": 6809678.0,
+ "step": 2920
+ },
+ {
+ "epoch": 7.2640099626401,
+ "eval_entropy": 0.2626111418182074,
+ "eval_loss": 0.8111525177955627,
+ "eval_mean_token_accuracy": 0.8512121695418691,
+ "eval_num_tokens": 6809678.0,
+ "eval_runtime": 85.9626,
+ "eval_samples_per_second": 15.995,
+ "eval_steps_per_second": 2.001,
+ "step": 2920
+ },
+ {
+ "entropy": 0.12644002586603165,
+ "epoch": 7.313823163138232,
+ "grad_norm": 0.27514681220054626,
+ "learning_rate": 4.6288641879189884e-05,
+ "loss": 0.06807711124420165,
+ "mean_token_accuracy": 0.9760703906416893,
+ "num_tokens": 6860750.0,
+ "step": 2940
+ },
+ {
+ "epoch": 7.313823163138232,
+ "eval_entropy": 0.26096762734097106,
+ "eval_loss": 0.8184595108032227,
+ "eval_mean_token_accuracy": 0.8501476153384807,
+ "eval_num_tokens": 6860750.0,
+ "eval_runtime": 85.9521,
+ "eval_samples_per_second": 15.997,
+ "eval_steps_per_second": 2.001,
+ "step": 2940
+ },
+ {
+ "entropy": 0.13920630998909472,
+ "epoch": 7.363636363636363,
+ "grad_norm": 0.23584705591201782,
+ "learning_rate": 4.4713640083838604e-05,
+ "loss": 0.07301607131958007,
+ "mean_token_accuracy": 0.9745715200901032,
+ "num_tokens": 6907092.0,
+ "step": 2960
+ },
+ {
+ "epoch": 7.363636363636363,
+ "eval_entropy": 0.2612536767021168,
+ "eval_loss": 0.8116245269775391,
+ "eval_mean_token_accuracy": 0.8510967350976412,
+ "eval_num_tokens": 6907092.0,
+ "eval_runtime": 85.6373,
+ "eval_samples_per_second": 16.056,
+ "eval_steps_per_second": 2.008,
+ "step": 2960
+ },
+ {
+ "entropy": 0.1349492883309722,
+ "epoch": 7.4134495641344955,
+ "grad_norm": 0.24552719295024872,
+ "learning_rate": 4.315927466345791e-05,
+ "loss": 0.07397544980049134,
+ "mean_token_accuracy": 0.9745095103979111,
+ "num_tokens": 6952700.0,
+ "step": 2980
+ },
+ {
+ "epoch": 7.4134495641344955,
+ "eval_entropy": 0.25796533306670744,
+ "eval_loss": 0.8266491293907166,
+ "eval_mean_token_accuracy": 0.8511653857868772,
+ "eval_num_tokens": 6952700.0,
+ "eval_runtime": 85.7462,
+ "eval_samples_per_second": 16.036,
+ "eval_steps_per_second": 2.006,
+ "step": 2980
+ },
+ {
+ "entropy": 0.14479175000451505,
+ "epoch": 7.463262764632628,
+ "grad_norm": 0.2846072018146515,
+ "learning_rate": 4.162601439345814e-05,
+ "loss": 0.07544798254966736,
+ "mean_token_accuracy": 0.9727819666266442,
+ "num_tokens": 6996430.0,
+ "step": 3000
+ },
+ {
+ "epoch": 7.463262764632628,
+ "eval_entropy": 0.2584348309698493,
+ "eval_loss": 0.8253348469734192,
+ "eval_mean_token_accuracy": 0.8511569815319638,
+ "eval_num_tokens": 6996430.0,
+ "eval_runtime": 86.2984,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 3000
+ },
+ {
+ "entropy": 0.14114196319133043,
+ "epoch": 7.51307596513076,
+ "grad_norm": 0.407966285943985,
+ "learning_rate": 4.011432168422419e-05,
+ "loss": 0.0736398994922638,
+ "mean_token_accuracy": 0.9741654269397259,
+ "num_tokens": 7042038.0,
+ "step": 3020
+ },
+ {
+ "epoch": 7.51307596513076,
+ "eval_entropy": 0.25232676260693127,
+ "eval_loss": 0.8296052813529968,
+ "eval_mean_token_accuracy": 0.8523298349491385,
+ "eval_num_tokens": 7042038.0,
+ "eval_runtime": 85.8445,
+ "eval_samples_per_second": 16.017,
+ "eval_steps_per_second": 2.004,
+ "step": 3020
+ },
+ {
+ "entropy": 0.1353456223383546,
+ "epoch": 7.562889165628892,
+ "grad_norm": 0.2712634801864624,
+ "learning_rate": 3.8624652441658684e-05,
+ "loss": 0.07362412214279175,
+ "mean_token_accuracy": 0.9747945807874203,
+ "num_tokens": 7089390.0,
+ "step": 3040
+ },
+ {
+ "epoch": 7.562889165628892,
+ "eval_entropy": 0.2579477243991785,
+ "eval_loss": 0.8274564743041992,
+ "eval_mean_token_accuracy": 0.8517705212498821,
+ "eval_num_tokens": 7089390.0,
+ "eval_runtime": 85.8222,
+ "eval_samples_per_second": 16.022,
+ "eval_steps_per_second": 2.004,
+ "step": 3040
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 2.9910336361862554e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3060/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3060/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3060/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3060/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3060/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3060/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3060/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3060/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3060/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3060/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3060/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3060/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3060/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3060/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..f3d7e1038c9220725bd717ecc4d62d5c291cdb4a
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3060/trainer_state.json
@@ -0,0 +1,3247 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 7.6127023661270234,
+ "eval_steps": 20,
+ "global_step": 3060,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ },
+ {
+ "entropy": 0.3193941755220294,
+ "epoch": 4.5280199252802,
+ "grad_norm": 0.8281906843185425,
+ "learning_rate": 0.0001509111761786888,
+ "loss": 0.23936262130737304,
+ "mean_token_accuracy": 0.9201708927750587,
+ "num_tokens": 4244423.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.5280199252802,
+ "eval_entropy": 0.38704028864239537,
+ "eval_loss": 0.6006569266319275,
+ "eval_mean_token_accuracy": 0.8502406720505205,
+ "eval_num_tokens": 4244423.0,
+ "eval_runtime": 86.8059,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1820
+ },
+ {
+ "entropy": 0.3164879363030195,
+ "epoch": 4.577833125778331,
+ "grad_norm": 0.7892968654632568,
+ "learning_rate": 0.00014905346557909867,
+ "loss": 0.24541733264923096,
+ "mean_token_accuracy": 0.9175932116806507,
+ "num_tokens": 4289773.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.577833125778331,
+ "eval_entropy": 0.38861122120951497,
+ "eval_loss": 0.6115967631340027,
+ "eval_mean_token_accuracy": 0.849471275196519,
+ "eval_num_tokens": 4289773.0,
+ "eval_runtime": 86.2946,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1840
+ },
+ {
+ "entropy": 0.3051785985007882,
+ "epoch": 4.627646326276463,
+ "grad_norm": 0.8109654188156128,
+ "learning_rate": 0.0001471849238862319,
+ "loss": 0.23433220386505127,
+ "mean_token_accuracy": 0.9206570319831371,
+ "num_tokens": 4336894.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.627646326276463,
+ "eval_entropy": 0.37162452295076015,
+ "eval_loss": 0.6184061765670776,
+ "eval_mean_token_accuracy": 0.8501173268223918,
+ "eval_num_tokens": 4336894.0,
+ "eval_runtime": 86.6865,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1860
+ },
+ {
+ "entropy": 0.3168198253959417,
+ "epoch": 4.677459526774595,
+ "grad_norm": 0.9512342214584351,
+ "learning_rate": 0.0001453061146267775,
+ "loss": 0.23832404613494873,
+ "mean_token_accuracy": 0.9197044663131237,
+ "num_tokens": 4382947.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.677459526774595,
+ "eval_entropy": 0.3845940856912801,
+ "eval_loss": 0.606762707233429,
+ "eval_mean_token_accuracy": 0.8504838194957999,
+ "eval_num_tokens": 4382947.0,
+ "eval_runtime": 86.5175,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 1880
+ },
+ {
+ "entropy": 0.30791807882487776,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 0.8123113512992859,
+ "learning_rate": 0.00014341760442398248,
+ "loss": 0.2395785331726074,
+ "mean_token_accuracy": 0.918928150832653,
+ "num_tokens": 4433050.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.7272727272727275,
+ "eval_entropy": 0.39762327222283494,
+ "eval_loss": 0.5994202494621277,
+ "eval_mean_token_accuracy": 0.8509274201337681,
+ "eval_num_tokens": 4433050.0,
+ "eval_runtime": 86.2873,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.993,
+ "step": 1900
+ },
+ {
+ "entropy": 0.3021434534341097,
+ "epoch": 4.777085927770859,
+ "grad_norm": 0.731787383556366,
+ "learning_rate": 0.000141519962826766,
+ "loss": 0.23494718074798585,
+ "mean_token_accuracy": 0.9201403826475143,
+ "num_tokens": 4483598.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.777085927770859,
+ "eval_entropy": 0.3827026732439219,
+ "eval_loss": 0.5995895862579346,
+ "eval_mean_token_accuracy": 0.851468373523202,
+ "eval_num_tokens": 4483598.0,
+ "eval_runtime": 86.3006,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 1920
+ },
+ {
+ "entropy": 0.31626159623265265,
+ "epoch": 4.826899128268991,
+ "grad_norm": 0.8848487138748169,
+ "learning_rate": 0.00013961376213795132,
+ "loss": 0.2439030647277832,
+ "mean_token_accuracy": 0.9196575872600079,
+ "num_tokens": 4529201.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.826899128268991,
+ "eval_entropy": 0.388698436839636,
+ "eval_loss": 0.6000174283981323,
+ "eval_mean_token_accuracy": 0.8518068187458571,
+ "eval_num_tokens": 4529201.0,
+ "eval_runtime": 86.8979,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.979,
+ "step": 1940
+ },
+ {
+ "entropy": 0.30520407035946845,
+ "epoch": 4.876712328767123,
+ "grad_norm": 0.8532460927963257,
+ "learning_rate": 0.00013769957724166695,
+ "loss": 0.23458616733551024,
+ "mean_token_accuracy": 0.9221912942826748,
+ "num_tokens": 4578167.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.876712328767123,
+ "eval_entropy": 0.38777847102908203,
+ "eval_loss": 0.6004981398582458,
+ "eval_mean_token_accuracy": 0.8516481768253238,
+ "eval_num_tokens": 4578167.0,
+ "eval_runtime": 87.0777,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.975,
+ "step": 1960
+ },
+ {
+ "entropy": 0.3226448342204094,
+ "epoch": 4.926525529265255,
+ "grad_norm": 0.6945561766624451,
+ "learning_rate": 0.0001357779854299694,
+ "loss": 0.24048397541046143,
+ "mean_token_accuracy": 0.9195300146937371,
+ "num_tokens": 4622316.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.926525529265255,
+ "eval_entropy": 0.38581624263247777,
+ "eval_loss": 0.6029234528541565,
+ "eval_mean_token_accuracy": 0.8514213260523108,
+ "eval_num_tokens": 4622316.0,
+ "eval_runtime": 85.8729,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 1980
+ },
+ {
+ "entropy": 0.3051655298098922,
+ "epoch": 4.976338729763388,
+ "grad_norm": 0.7976452708244324,
+ "learning_rate": 0.00013384956622874001,
+ "loss": 0.23584742546081544,
+ "mean_token_accuracy": 0.9216851457953453,
+ "num_tokens": 4670746.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.976338729763388,
+ "eval_entropy": 0.37913159246361533,
+ "eval_loss": 0.6057604551315308,
+ "eval_mean_token_accuracy": 0.8525801203971686,
+ "eval_num_tokens": 4670746.0,
+ "eval_runtime": 86.1145,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2000
+ },
+ {
+ "entropy": 0.27438195240803254,
+ "epoch": 5.024906600249066,
+ "grad_norm": 0.6729586124420166,
+ "learning_rate": 0.0001319149012229075,
+ "loss": 0.19775952100753785,
+ "mean_token_accuracy": 0.9339428559327737,
+ "num_tokens": 4716176.0,
+ "step": 2020
+ },
+ {
+ "epoch": 5.024906600249066,
+ "eval_entropy": 0.3448961910813354,
+ "eval_loss": 0.6750120520591736,
+ "eval_mean_token_accuracy": 0.8487970232963562,
+ "eval_num_tokens": 4716176.0,
+ "eval_runtime": 86.1169,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2020
+ },
+ {
+ "entropy": 0.21423916313797237,
+ "epoch": 5.074719800747198,
+ "grad_norm": 0.6934391856193542,
+ "learning_rate": 0.00012997457388105022,
+ "loss": 0.1439570426940918,
+ "mean_token_accuracy": 0.9528236843645572,
+ "num_tokens": 4763269.0,
+ "step": 2040
+ },
+ {
+ "epoch": 5.074719800747198,
+ "eval_entropy": 0.3570949243771475,
+ "eval_loss": 0.6465504169464111,
+ "eval_mean_token_accuracy": 0.8490785547467166,
+ "eval_num_tokens": 4763269.0,
+ "eval_runtime": 85.9574,
+ "eval_samples_per_second": 15.996,
+ "eval_steps_per_second": 2.001,
+ "step": 2040
+ },
+ {
+ "entropy": 0.20838565267622472,
+ "epoch": 5.12453300124533,
+ "grad_norm": 0.7286986112594604,
+ "learning_rate": 0.00012802916937942972,
+ "loss": 0.14467307329177856,
+ "mean_token_accuracy": 0.950994835793972,
+ "num_tokens": 4809047.0,
+ "step": 2060
+ },
+ {
+ "epoch": 5.12453300124533,
+ "eval_entropy": 0.3452463157821533,
+ "eval_loss": 0.6705958843231201,
+ "eval_mean_token_accuracy": 0.8490352796953778,
+ "eval_num_tokens": 4809047.0,
+ "eval_runtime": 86.228,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 2060
+ },
+ {
+ "entropy": 0.20453082229942082,
+ "epoch": 5.174346201743462,
+ "grad_norm": 0.7515555620193481,
+ "learning_rate": 0.00012607927442550974,
+ "loss": 0.13732000589370727,
+ "mean_token_accuracy": 0.9537357829511166,
+ "num_tokens": 4857965.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.174346201743462,
+ "eval_entropy": 0.32431264914745506,
+ "eval_loss": 0.6743043065071106,
+ "eval_mean_token_accuracy": 0.8504878629085629,
+ "eval_num_tokens": 4857965.0,
+ "eval_runtime": 86.5948,
+ "eval_samples_per_second": 15.879,
+ "eval_steps_per_second": 1.986,
+ "step": 2080
+ },
+ {
+ "entropy": 0.21812320686876774,
+ "epoch": 5.224159402241594,
+ "grad_norm": 0.9093465209007263,
+ "learning_rate": 0.0001241254770810132,
+ "loss": 0.14311420917510986,
+ "mean_token_accuracy": 0.9514068141579628,
+ "num_tokens": 4905151.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.224159402241594,
+ "eval_entropy": 0.33086285835435225,
+ "eval_loss": 0.6676449179649353,
+ "eval_mean_token_accuracy": 0.8505287662495015,
+ "eval_num_tokens": 4905151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 2100
+ },
+ {
+ "entropy": 0.2180163251236081,
+ "epoch": 5.273972602739726,
+ "grad_norm": 0.6703007221221924,
+ "learning_rate": 0.00012216836658457075,
+ "loss": 0.14803968667984008,
+ "mean_token_accuracy": 0.9521303348243236,
+ "num_tokens": 4947072.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.273972602739726,
+ "eval_entropy": 0.33162341708707255,
+ "eval_loss": 0.6658875942230225,
+ "eval_mean_token_accuracy": 0.8500757605530495,
+ "eval_num_tokens": 4947072.0,
+ "eval_runtime": 86.6296,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 2120
+ },
+ {
+ "entropy": 0.22511130161583423,
+ "epoch": 5.323785803237858,
+ "grad_norm": 0.8078880906105042,
+ "learning_rate": 0.00012020853317401455,
+ "loss": 0.15228408575057983,
+ "mean_token_accuracy": 0.947144789993763,
+ "num_tokens": 4991974.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.323785803237858,
+ "eval_entropy": 0.3354601170434508,
+ "eval_loss": 0.6677829623222351,
+ "eval_mean_token_accuracy": 0.8482600024273229,
+ "eval_num_tokens": 4991974.0,
+ "eval_runtime": 86.4689,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.989,
+ "step": 2140
+ },
+ {
+ "entropy": 0.2244176059961319,
+ "epoch": 5.37359900373599,
+ "grad_norm": 0.9636075496673584,
+ "learning_rate": 0.00011824656790837037,
+ "loss": 0.15260883569717407,
+ "mean_token_accuracy": 0.9471467643976211,
+ "num_tokens": 5038400.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.37359900373599,
+ "eval_entropy": 0.3381616926297199,
+ "eval_loss": 0.6694412231445312,
+ "eval_mean_token_accuracy": 0.8482369603805764,
+ "eval_num_tokens": 5038400.0,
+ "eval_runtime": 86.4147,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 2160
+ },
+ {
+ "entropy": 0.22982364390045404,
+ "epoch": 5.423412204234122,
+ "grad_norm": 0.775401771068573,
+ "learning_rate": 0.00011628306248960262,
+ "loss": 0.15140302181243898,
+ "mean_token_accuracy": 0.9492553934454918,
+ "num_tokens": 5083166.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.423412204234122,
+ "eval_entropy": 0.3305150235808173,
+ "eval_loss": 0.6717822551727295,
+ "eval_mean_token_accuracy": 0.8489849723355715,
+ "eval_num_tokens": 5083166.0,
+ "eval_runtime": 86.4728,
+ "eval_samples_per_second": 15.901,
+ "eval_steps_per_second": 1.989,
+ "step": 2180
+ },
+ {
+ "entropy": 0.21448935717344284,
+ "epoch": 5.473225404732254,
+ "grad_norm": 0.6575281023979187,
+ "learning_rate": 0.00011431860908416465,
+ "loss": 0.1452319622039795,
+ "mean_token_accuracy": 0.9505287684500218,
+ "num_tokens": 5135109.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.473225404732254,
+ "eval_entropy": 0.3488145174328671,
+ "eval_loss": 0.6612305641174316,
+ "eval_mean_token_accuracy": 0.8492907808963642,
+ "eval_num_tokens": 5135109.0,
+ "eval_runtime": 86.6927,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 2200
+ },
+ {
+ "entropy": 0.23091202937066554,
+ "epoch": 5.523038605230386,
+ "grad_norm": 0.8909686207771301,
+ "learning_rate": 0.00011235380014440985,
+ "loss": 0.15150139331817628,
+ "mean_token_accuracy": 0.9497875183820724,
+ "num_tokens": 5180138.0,
+ "step": 2220
+ },
+ {
+ "epoch": 5.523038605230386,
+ "eval_entropy": 0.3268539015810157,
+ "eval_loss": 0.6667542457580566,
+ "eval_mean_token_accuracy": 0.8499062903398691,
+ "eval_num_tokens": 5180138.0,
+ "eval_runtime": 86.4644,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 2220
+ },
+ {
+ "entropy": 0.2227974807843566,
+ "epoch": 5.572851805728518,
+ "grad_norm": 0.6180275082588196,
+ "learning_rate": 0.0001103892282299158,
+ "loss": 0.1491069197654724,
+ "mean_token_accuracy": 0.9488144010305405,
+ "num_tokens": 5226864.0,
+ "step": 2240
+ },
+ {
+ "epoch": 5.572851805728518,
+ "eval_entropy": 0.3346347655494546,
+ "eval_loss": 0.6665948629379272,
+ "eval_mean_token_accuracy": 0.8499961893918903,
+ "eval_num_tokens": 5226864.0,
+ "eval_runtime": 87.0548,
+ "eval_samples_per_second": 15.795,
+ "eval_steps_per_second": 1.976,
+ "step": 2240
+ },
+ {
+ "entropy": 0.21368421968072654,
+ "epoch": 5.62266500622665,
+ "grad_norm": 0.6004369258880615,
+ "learning_rate": 0.00010842548582877651,
+ "loss": 0.14485255479812623,
+ "mean_token_accuracy": 0.9502056457102299,
+ "num_tokens": 5276602.0,
+ "step": 2260
+ },
+ {
+ "epoch": 5.62266500622665,
+ "eval_entropy": 0.32753298804163933,
+ "eval_loss": 0.6680151224136353,
+ "eval_mean_token_accuracy": 0.8515451086121936,
+ "eval_num_tokens": 5276602.0,
+ "eval_runtime": 86.8524,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.98,
+ "step": 2260
+ },
+ {
+ "entropy": 0.2103635374456644,
+ "epoch": 5.672478206724782,
+ "grad_norm": 0.699174702167511,
+ "learning_rate": 0.00010646316517891613,
+ "loss": 0.14297772645950318,
+ "mean_token_accuracy": 0.9512537539005279,
+ "num_tokens": 5323718.0,
+ "step": 2280
+ },
+ {
+ "epoch": 5.672478206724782,
+ "eval_entropy": 0.32966585959806,
+ "eval_loss": 0.675578773021698,
+ "eval_mean_token_accuracy": 0.8509623023659684,
+ "eval_num_tokens": 5323718.0,
+ "eval_runtime": 86.4518,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2280
+ },
+ {
+ "entropy": 0.22516900151968003,
+ "epoch": 5.722291407222914,
+ "grad_norm": 0.6637354493141174,
+ "learning_rate": 0.00010450285808947797,
+ "loss": 0.15202572345733642,
+ "mean_token_accuracy": 0.9482452072203159,
+ "num_tokens": 5369039.0,
+ "step": 2300
+ },
+ {
+ "epoch": 5.722291407222914,
+ "eval_entropy": 0.3369456917740578,
+ "eval_loss": 0.6697061061859131,
+ "eval_mean_token_accuracy": 0.848603522361711,
+ "eval_num_tokens": 5369039.0,
+ "eval_runtime": 86.6371,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.985,
+ "step": 2300
+ },
+ {
+ "entropy": 0.21841065725311637,
+ "epoch": 5.772104607721046,
+ "grad_norm": 0.7940268516540527,
+ "learning_rate": 0.00010254515576234297,
+ "loss": 0.14710167646408082,
+ "mean_token_accuracy": 0.9493498183786869,
+ "num_tokens": 5417029.0,
+ "step": 2320
+ },
+ {
+ "epoch": 5.772104607721046,
+ "eval_entropy": 0.3237486180177955,
+ "eval_loss": 0.6779657602310181,
+ "eval_mean_token_accuracy": 0.8500715313955794,
+ "eval_num_tokens": 5417029.0,
+ "eval_runtime": 86.1826,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 1.996,
+ "step": 2320
+ },
+ {
+ "entropy": 0.22146204356104135,
+ "epoch": 5.821917808219178,
+ "grad_norm": 0.9234833121299744,
+ "learning_rate": 0.00010059064861383132,
+ "loss": 0.14720046520233154,
+ "mean_token_accuracy": 0.9493872679769992,
+ "num_tokens": 5461671.0,
+ "step": 2340
+ },
+ {
+ "epoch": 5.821917808219178,
+ "eval_entropy": 0.32365207564692167,
+ "eval_loss": 0.6704005002975464,
+ "eval_mean_token_accuracy": 0.8507985760306203,
+ "eval_num_tokens": 5461671.0,
+ "eval_runtime": 86.5494,
+ "eval_samples_per_second": 15.887,
+ "eval_steps_per_second": 1.987,
+ "step": 2340
+ },
+ {
+ "entropy": 0.20934011954814197,
+ "epoch": 5.87173100871731,
+ "grad_norm": 0.5547503232955933,
+ "learning_rate": 9.863992609664084e-05,
+ "loss": 0.1464867353439331,
+ "mean_token_accuracy": 0.9503875687718392,
+ "num_tokens": 5509312.0,
+ "step": 2360
+ },
+ {
+ "epoch": 5.87173100871731,
+ "eval_entropy": 0.3330401429083458,
+ "eval_loss": 0.6659091114997864,
+ "eval_mean_token_accuracy": 0.8504848906467127,
+ "eval_num_tokens": 5509312.0,
+ "eval_runtime": 86.5855,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 2360
+ },
+ {
+ "entropy": 0.21678635366261007,
+ "epoch": 5.921544209215442,
+ "grad_norm": 0.570612907409668,
+ "learning_rate": 9.669357652207635e-05,
+ "loss": 0.14821385145187377,
+ "mean_token_accuracy": 0.9503940217196941,
+ "num_tokens": 5558196.0,
+ "step": 2380
+ },
+ {
+ "epoch": 5.921544209215442,
+ "eval_entropy": 0.3322022325077722,
+ "eval_loss": 0.6722489595413208,
+ "eval_mean_token_accuracy": 0.8489979422369669,
+ "eval_num_tokens": 5558196.0,
+ "eval_runtime": 86.2986,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 2380
+ },
+ {
+ "entropy": 0.20932920072227718,
+ "epoch": 5.971357409713574,
+ "grad_norm": 0.7879557609558105,
+ "learning_rate": 9.475218688262262e-05,
+ "loss": 0.14675841331481934,
+ "mean_token_accuracy": 0.9507176131010056,
+ "num_tokens": 5605400.0,
+ "step": 2400
+ },
+ {
+ "epoch": 5.971357409713574,
+ "eval_entropy": 0.3199348642902319,
+ "eval_loss": 0.6698136329650879,
+ "eval_mean_token_accuracy": 0.8514142130003419,
+ "eval_num_tokens": 5605400.0,
+ "eval_runtime": 85.8995,
+ "eval_samples_per_second": 16.007,
+ "eval_steps_per_second": 2.002,
+ "step": 2400
+ },
+ {
+ "entropy": 0.21032143919131693,
+ "epoch": 6.019925280199253,
+ "grad_norm": 0.5823076367378235,
+ "learning_rate": 9.281634267491569e-05,
+ "loss": 0.13322267532348633,
+ "mean_token_accuracy": 0.9550939072401096,
+ "num_tokens": 5648968.0,
+ "step": 2420
+ },
+ {
+ "epoch": 6.019925280199253,
+ "eval_entropy": 0.30206270117399303,
+ "eval_loss": 0.7093168497085571,
+ "eval_mean_token_accuracy": 0.8500627639681794,
+ "eval_num_tokens": 5648968.0,
+ "eval_runtime": 85.8128,
+ "eval_samples_per_second": 16.023,
+ "eval_steps_per_second": 2.004,
+ "step": 2420
+ },
+ {
+ "entropy": 0.1534628233872354,
+ "epoch": 6.069738480697385,
+ "grad_norm": 0.710133969783783,
+ "learning_rate": 9.088662772316508e-05,
+ "loss": 0.09078952670097351,
+ "mean_token_accuracy": 0.9678447999060154,
+ "num_tokens": 5697633.0,
+ "step": 2440
+ },
+ {
+ "epoch": 6.069738480697385,
+ "eval_entropy": 0.28208133101809857,
+ "eval_loss": 0.7636417150497437,
+ "eval_mean_token_accuracy": 0.8494061477655588,
+ "eval_num_tokens": 5697633.0,
+ "eval_runtime": 85.9724,
+ "eval_samples_per_second": 15.994,
+ "eval_steps_per_second": 2.001,
+ "step": 2440
+ },
+ {
+ "entropy": 0.16151462448760867,
+ "epoch": 6.119551681195516,
+ "grad_norm": 0.5793812274932861,
+ "learning_rate": 8.896362400308028e-05,
+ "loss": 0.09545697569847107,
+ "mean_token_accuracy": 0.9671573750674725,
+ "num_tokens": 5745090.0,
+ "step": 2460
+ },
+ {
+ "epoch": 6.119551681195516,
+ "eval_entropy": 0.2833245605403601,
+ "eval_loss": 0.7402405738830566,
+ "eval_mean_token_accuracy": 0.8503523728875226,
+ "eval_num_tokens": 5745090.0,
+ "eval_runtime": 85.5461,
+ "eval_samples_per_second": 16.073,
+ "eval_steps_per_second": 2.011,
+ "step": 2460
+ },
+ {
+ "entropy": 0.15203177919611335,
+ "epoch": 6.169364881693649,
+ "grad_norm": 0.4251123368740082,
+ "learning_rate": 8.704791146635483e-05,
+ "loss": 0.09420782327651978,
+ "mean_token_accuracy": 0.9677386932075024,
+ "num_tokens": 5790333.0,
+ "step": 2480
+ },
+ {
+ "epoch": 6.169364881693649,
+ "eval_entropy": 0.28572545962971313,
+ "eval_loss": 0.735416829586029,
+ "eval_mean_token_accuracy": 0.8487084663884584,
+ "eval_num_tokens": 5790333.0,
+ "eval_runtime": 85.4801,
+ "eval_samples_per_second": 16.086,
+ "eval_steps_per_second": 2.012,
+ "step": 2480
+ },
+ {
+ "entropy": 0.15587336672469973,
+ "epoch": 6.219178082191781,
+ "grad_norm": 0.4357028007507324,
+ "learning_rate": 8.514006786576085e-05,
+ "loss": 0.09429320096969604,
+ "mean_token_accuracy": 0.9682952925562859,
+ "num_tokens": 5837321.0,
+ "step": 2500
+ },
+ {
+ "epoch": 6.219178082191781,
+ "eval_entropy": 0.2859006894882335,
+ "eval_loss": 0.7347224950790405,
+ "eval_mean_token_accuracy": 0.8501905518215757,
+ "eval_num_tokens": 5837321.0,
+ "eval_runtime": 85.7578,
+ "eval_samples_per_second": 16.034,
+ "eval_steps_per_second": 2.006,
+ "step": 2500
+ },
+ {
+ "entropy": 0.15765639198943973,
+ "epoch": 6.268991282689913,
+ "grad_norm": 0.47331130504608154,
+ "learning_rate": 8.324066858090663e-05,
+ "loss": 0.09571113586425781,
+ "mean_token_accuracy": 0.9683481335639954,
+ "num_tokens": 5884398.0,
+ "step": 2520
+ },
+ {
+ "epoch": 6.268991282689913,
+ "eval_entropy": 0.29231513846059176,
+ "eval_loss": 0.7392512559890747,
+ "eval_mean_token_accuracy": 0.8486633983462356,
+ "eval_num_tokens": 5884398.0,
+ "eval_runtime": 85.7846,
+ "eval_samples_per_second": 16.029,
+ "eval_steps_per_second": 2.005,
+ "step": 2520
+ },
+ {
+ "entropy": 0.16176860257983208,
+ "epoch": 6.318804483188045,
+ "grad_norm": 0.6142018437385559,
+ "learning_rate": 8.135028644470992e-05,
+ "loss": 0.09486144185066223,
+ "mean_token_accuracy": 0.9682316601276397,
+ "num_tokens": 5929876.0,
+ "step": 2540
+ },
+ {
+ "epoch": 6.318804483188045,
+ "eval_entropy": 0.2851274753379267,
+ "eval_loss": 0.7520816922187805,
+ "eval_mean_token_accuracy": 0.8501113649717597,
+ "eval_num_tokens": 5929876.0,
+ "eval_runtime": 85.9425,
+ "eval_samples_per_second": 15.999,
+ "eval_steps_per_second": 2.001,
+ "step": 2540
+ },
+ {
+ "entropy": 0.15404034564271568,
+ "epoch": 6.3686176836861765,
+ "grad_norm": 0.6051287651062012,
+ "learning_rate": 7.946949157063964e-05,
+ "loss": 0.09280472993850708,
+ "mean_token_accuracy": 0.9684635892510414,
+ "num_tokens": 5978490.0,
+ "step": 2560
+ },
+ {
+ "epoch": 6.3686176836861765,
+ "eval_entropy": 0.28802703563557114,
+ "eval_loss": 0.7439162135124207,
+ "eval_mean_token_accuracy": 0.8499851770872293,
+ "eval_num_tokens": 5978490.0,
+ "eval_runtime": 86.0703,
+ "eval_samples_per_second": 15.975,
+ "eval_steps_per_second": 1.998,
+ "step": 2560
+ },
+ {
+ "entropy": 0.15343588953837753,
+ "epoch": 6.418430884184309,
+ "grad_norm": 0.4823743402957916,
+ "learning_rate": 7.759885118077701e-05,
+ "loss": 0.09000591039657593,
+ "mean_token_accuracy": 0.9699928767979145,
+ "num_tokens": 6025380.0,
+ "step": 2580
+ },
+ {
+ "epoch": 6.418430884184309,
+ "eval_entropy": 0.2795634938533916,
+ "eval_loss": 0.7647850513458252,
+ "eval_mean_token_accuracy": 0.8503464397995971,
+ "eval_num_tokens": 6025380.0,
+ "eval_runtime": 85.8886,
+ "eval_samples_per_second": 16.009,
+ "eval_steps_per_second": 2.003,
+ "step": 2580
+ },
+ {
+ "entropy": 0.15740026142448188,
+ "epoch": 6.468244084682441,
+ "grad_norm": 0.5082696676254272,
+ "learning_rate": 7.57389294347494e-05,
+ "loss": 0.09191849827766418,
+ "mean_token_accuracy": 0.9692809768021107,
+ "num_tokens": 6073349.0,
+ "step": 2600
+ },
+ {
+ "epoch": 6.468244084682441,
+ "eval_entropy": 0.2913342311458532,
+ "eval_loss": 0.7518694996833801,
+ "eval_mean_token_accuracy": 0.8483168302580367,
+ "eval_num_tokens": 6073349.0,
+ "eval_runtime": 85.5761,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.01,
+ "step": 2600
+ },
+ {
+ "entropy": 0.15922069251537324,
+ "epoch": 6.518057285180573,
+ "grad_norm": 0.3995199501514435,
+ "learning_rate": 7.389028725958736e-05,
+ "loss": 0.09584367871284485,
+ "mean_token_accuracy": 0.9685114495456218,
+ "num_tokens": 6118148.0,
+ "step": 2620
+ },
+ {
+ "epoch": 6.518057285180573,
+ "eval_entropy": 0.2863075934177221,
+ "eval_loss": 0.7539381384849548,
+ "eval_mean_token_accuracy": 0.8507507083027862,
+ "eval_num_tokens": 6118148.0,
+ "eval_runtime": 86.112,
+ "eval_samples_per_second": 15.968,
+ "eval_steps_per_second": 1.997,
+ "step": 2620
+ },
+ {
+ "entropy": 0.16197575423866512,
+ "epoch": 6.567870485678705,
+ "grad_norm": 0.534295380115509,
+ "learning_rate": 7.205348218055678e-05,
+ "loss": 0.0961170256137848,
+ "mean_token_accuracy": 0.9674530044198036,
+ "num_tokens": 6165523.0,
+ "step": 2640
+ },
+ {
+ "epoch": 6.567870485678705,
+ "eval_entropy": 0.29021967315050057,
+ "eval_loss": 0.751198947429657,
+ "eval_mean_token_accuracy": 0.8509796344956686,
+ "eval_num_tokens": 6165523.0,
+ "eval_runtime": 85.7958,
+ "eval_samples_per_second": 16.026,
+ "eval_steps_per_second": 2.005,
+ "step": 2640
+ },
+ {
+ "entropy": 0.15261746793985367,
+ "epoch": 6.617683686176837,
+ "grad_norm": 0.5391237139701843,
+ "learning_rate": 7.022906815301673e-05,
+ "loss": 0.0926026999950409,
+ "mean_token_accuracy": 0.9695659473538398,
+ "num_tokens": 6216232.0,
+ "step": 2660
+ },
+ {
+ "epoch": 6.617683686176837,
+ "eval_entropy": 0.29128045216202736,
+ "eval_loss": 0.7450292110443115,
+ "eval_mean_token_accuracy": 0.8498771443616512,
+ "eval_num_tokens": 6216232.0,
+ "eval_runtime": 86.3963,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 2660
+ },
+ {
+ "entropy": 0.16164180357009172,
+ "epoch": 6.667496886674969,
+ "grad_norm": 0.5767946243286133,
+ "learning_rate": 6.841759539535419e-05,
+ "loss": 0.09291981458663941,
+ "mean_token_accuracy": 0.9687136687338352,
+ "num_tokens": 6264807.0,
+ "step": 2680
+ },
+ {
+ "epoch": 6.667496886674969,
+ "eval_entropy": 0.2897637223088464,
+ "eval_loss": 0.7503410577774048,
+ "eval_mean_token_accuracy": 0.8503315164599308,
+ "eval_num_tokens": 6264807.0,
+ "eval_runtime": 86.0653,
+ "eval_samples_per_second": 15.976,
+ "eval_steps_per_second": 1.998,
+ "step": 2680
+ },
+ {
+ "entropy": 0.17062523355707526,
+ "epoch": 6.717310087173101,
+ "grad_norm": 0.4974168539047241,
+ "learning_rate": 6.661961022304563e-05,
+ "loss": 0.09713236689567566,
+ "mean_token_accuracy": 0.9661971725523472,
+ "num_tokens": 6308819.0,
+ "step": 2700
+ },
+ {
+ "epoch": 6.717310087173101,
+ "eval_entropy": 0.2765843396963075,
+ "eval_loss": 0.7604002356529236,
+ "eval_mean_token_accuracy": 0.8521115277395692,
+ "eval_num_tokens": 6308819.0,
+ "eval_runtime": 86.1676,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 2700
+ },
+ {
+ "entropy": 0.17544092936441302,
+ "epoch": 6.767123287671232,
+ "grad_norm": 0.5523537993431091,
+ "learning_rate": 6.483565488389582e-05,
+ "loss": 0.09709116220474243,
+ "mean_token_accuracy": 0.9650957375764847,
+ "num_tokens": 6352548.0,
+ "step": 2720
+ },
+ {
+ "epoch": 6.767123287671232,
+ "eval_entropy": 0.27939334659035814,
+ "eval_loss": 0.7534670829772949,
+ "eval_mean_token_accuracy": 0.851230604010959,
+ "eval_num_tokens": 6352548.0,
+ "eval_runtime": 86.2913,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 2720
+ },
+ {
+ "entropy": 0.15991022661328316,
+ "epoch": 6.816936488169365,
+ "grad_norm": 0.478551983833313,
+ "learning_rate": 6.306626739450311e-05,
+ "loss": 0.09564646482467651,
+ "mean_token_accuracy": 0.9679084822535515,
+ "num_tokens": 6397720.0,
+ "step": 2740
+ },
+ {
+ "epoch": 6.816936488169365,
+ "eval_entropy": 0.27878295491601146,
+ "eval_loss": 0.7519959211349487,
+ "eval_mean_token_accuracy": 0.8510654949864676,
+ "eval_num_tokens": 6397720.0,
+ "eval_runtime": 85.9109,
+ "eval_samples_per_second": 16.005,
+ "eval_steps_per_second": 2.002,
+ "step": 2740
+ },
+ {
+ "entropy": 0.16824879590421915,
+ "epoch": 6.866749688667497,
+ "grad_norm": 0.6681098937988281,
+ "learning_rate": 6.131198137800108e-05,
+ "loss": 0.0962279736995697,
+ "mean_token_accuracy": 0.966830012947321,
+ "num_tokens": 6442821.0,
+ "step": 2760
+ },
+ {
+ "epoch": 6.866749688667497,
+ "eval_entropy": 0.2834690434121808,
+ "eval_loss": 0.751922070980072,
+ "eval_mean_token_accuracy": 0.8521237577809844,
+ "eval_num_tokens": 6442821.0,
+ "eval_runtime": 86.3618,
+ "eval_samples_per_second": 15.921,
+ "eval_steps_per_second": 1.992,
+ "step": 2760
+ },
+ {
+ "entropy": 0.1518704930320382,
+ "epoch": 6.916562889165629,
+ "grad_norm": 0.5201290249824524,
+ "learning_rate": 5.957332590312513e-05,
+ "loss": 0.09010660648345947,
+ "mean_token_accuracy": 0.9693463340401649,
+ "num_tokens": 6494118.0,
+ "step": 2780
+ },
+ {
+ "epoch": 6.916562889165629,
+ "eval_entropy": 0.28485129617674404,
+ "eval_loss": 0.7452457547187805,
+ "eval_mean_token_accuracy": 0.8512036796919135,
+ "eval_num_tokens": 6494118.0,
+ "eval_runtime": 86.4524,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2780
+ },
+ {
+ "entropy": 0.15512610590085388,
+ "epoch": 6.966376089663761,
+ "grad_norm": 0.42802050709724426,
+ "learning_rate": 5.785082532465233e-05,
+ "loss": 0.09320432543754578,
+ "mean_token_accuracy": 0.9686134628951549,
+ "num_tokens": 6540175.0,
+ "step": 2800
+ },
+ {
+ "epoch": 6.966376089663761,
+ "eval_entropy": 0.27554594526110693,
+ "eval_loss": 0.7644653916358948,
+ "eval_mean_token_accuracy": 0.8513738523389018,
+ "eval_num_tokens": 6540175.0,
+ "eval_runtime": 85.7609,
+ "eval_samples_per_second": 16.033,
+ "eval_steps_per_second": 2.006,
+ "step": 2800
+ },
+ {
+ "entropy": 0.17524497526196334,
+ "epoch": 7.01494396014944,
+ "grad_norm": 0.3330269157886505,
+ "learning_rate": 5.6144999125263545e-05,
+ "loss": 0.0895616888999939,
+ "mean_token_accuracy": 0.9682766932707566,
+ "num_tokens": 6583767.0,
+ "step": 2820
+ },
+ {
+ "epoch": 7.01494396014944,
+ "eval_entropy": 0.2735865569218647,
+ "eval_loss": 0.768479585647583,
+ "eval_mean_token_accuracy": 0.8503459383581959,
+ "eval_num_tokens": 6583767.0,
+ "eval_runtime": 85.7162,
+ "eval_samples_per_second": 16.041,
+ "eval_steps_per_second": 2.007,
+ "step": 2820
+ },
+ {
+ "entropy": 0.1403565663844347,
+ "epoch": 7.064757160647572,
+ "grad_norm": 0.35613498091697693,
+ "learning_rate": 5.4456361758874235e-05,
+ "loss": 0.07551313638687134,
+ "mean_token_accuracy": 0.9739301167428493,
+ "num_tokens": 6627672.0,
+ "step": 2840
+ },
+ {
+ "epoch": 7.064757160647572,
+ "eval_entropy": 0.25941789089593775,
+ "eval_loss": 0.8209511637687683,
+ "eval_mean_token_accuracy": 0.8505055855873019,
+ "eval_num_tokens": 6627672.0,
+ "eval_runtime": 86.0943,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 2840
+ },
+ {
+ "entropy": 0.13500106502324344,
+ "epoch": 7.114570361145703,
+ "grad_norm": 0.34418627619743347,
+ "learning_rate": 5.2785422495482234e-05,
+ "loss": 0.07293946146965027,
+ "mean_token_accuracy": 0.9747208289802074,
+ "num_tokens": 6672946.0,
+ "step": 2860
+ },
+ {
+ "epoch": 7.114570361145703,
+ "eval_entropy": 0.26482899772912954,
+ "eval_loss": 0.798904538154602,
+ "eval_mean_token_accuracy": 0.8511530233677044,
+ "eval_num_tokens": 6672946.0,
+ "eval_runtime": 85.7915,
+ "eval_samples_per_second": 16.027,
+ "eval_steps_per_second": 2.005,
+ "step": 2860
+ },
+ {
+ "entropy": 0.13127502552233636,
+ "epoch": 7.164383561643835,
+ "grad_norm": 0.4638441503047943,
+ "learning_rate": 5.113268526757892e-05,
+ "loss": 0.07121461629867554,
+ "mean_token_accuracy": 0.9756786689162255,
+ "num_tokens": 6718582.0,
+ "step": 2880
+ },
+ {
+ "epoch": 7.164383561643835,
+ "eval_entropy": 0.2645381211714689,
+ "eval_loss": 0.809101939201355,
+ "eval_mean_token_accuracy": 0.8514727898115335,
+ "eval_num_tokens": 6718582.0,
+ "eval_runtime": 85.84,
+ "eval_samples_per_second": 16.018,
+ "eval_steps_per_second": 2.004,
+ "step": 2880
+ },
+ {
+ "entropy": 0.1331390908919275,
+ "epoch": 7.214196762141968,
+ "grad_norm": 0.40206775069236755,
+ "learning_rate": 4.949864851817007e-05,
+ "loss": 0.07188264131546021,
+ "mean_token_accuracy": 0.9755406074225903,
+ "num_tokens": 6764387.0,
+ "step": 2900
+ },
+ {
+ "epoch": 7.214196762141968,
+ "eval_entropy": 0.26244733283339544,
+ "eval_loss": 0.8143188953399658,
+ "eval_mean_token_accuracy": 0.8514358189909957,
+ "eval_num_tokens": 6764387.0,
+ "eval_runtime": 85.8546,
+ "eval_samples_per_second": 16.015,
+ "eval_steps_per_second": 2.003,
+ "step": 2900
+ },
+ {
+ "entropy": 0.13647331558167936,
+ "epoch": 7.2640099626401,
+ "grad_norm": 0.26405787467956543,
+ "learning_rate": 4.788380505045224e-05,
+ "loss": 0.07412450313568116,
+ "mean_token_accuracy": 0.9744274213910102,
+ "num_tokens": 6809678.0,
+ "step": 2920
+ },
+ {
+ "epoch": 7.2640099626401,
+ "eval_entropy": 0.2626111418182074,
+ "eval_loss": 0.8111525177955627,
+ "eval_mean_token_accuracy": 0.8512121695418691,
+ "eval_num_tokens": 6809678.0,
+ "eval_runtime": 85.9626,
+ "eval_samples_per_second": 15.995,
+ "eval_steps_per_second": 2.001,
+ "step": 2920
+ },
+ {
+ "entropy": 0.12644002586603165,
+ "epoch": 7.313823163138232,
+ "grad_norm": 0.27514681220054626,
+ "learning_rate": 4.6288641879189884e-05,
+ "loss": 0.06807711124420165,
+ "mean_token_accuracy": 0.9760703906416893,
+ "num_tokens": 6860750.0,
+ "step": 2940
+ },
+ {
+ "epoch": 7.313823163138232,
+ "eval_entropy": 0.26096762734097106,
+ "eval_loss": 0.8184595108032227,
+ "eval_mean_token_accuracy": 0.8501476153384807,
+ "eval_num_tokens": 6860750.0,
+ "eval_runtime": 85.9521,
+ "eval_samples_per_second": 15.997,
+ "eval_steps_per_second": 2.001,
+ "step": 2940
+ },
+ {
+ "entropy": 0.13920630998909472,
+ "epoch": 7.363636363636363,
+ "grad_norm": 0.23584705591201782,
+ "learning_rate": 4.4713640083838604e-05,
+ "loss": 0.07301607131958007,
+ "mean_token_accuracy": 0.9745715200901032,
+ "num_tokens": 6907092.0,
+ "step": 2960
+ },
+ {
+ "epoch": 7.363636363636363,
+ "eval_entropy": 0.2612536767021168,
+ "eval_loss": 0.8116245269775391,
+ "eval_mean_token_accuracy": 0.8510967350976412,
+ "eval_num_tokens": 6907092.0,
+ "eval_runtime": 85.6373,
+ "eval_samples_per_second": 16.056,
+ "eval_steps_per_second": 2.008,
+ "step": 2960
+ },
+ {
+ "entropy": 0.1349492883309722,
+ "epoch": 7.4134495641344955,
+ "grad_norm": 0.24552719295024872,
+ "learning_rate": 4.315927466345791e-05,
+ "loss": 0.07397544980049134,
+ "mean_token_accuracy": 0.9745095103979111,
+ "num_tokens": 6952700.0,
+ "step": 2980
+ },
+ {
+ "epoch": 7.4134495641344955,
+ "eval_entropy": 0.25796533306670744,
+ "eval_loss": 0.8266491293907166,
+ "eval_mean_token_accuracy": 0.8511653857868772,
+ "eval_num_tokens": 6952700.0,
+ "eval_runtime": 85.7462,
+ "eval_samples_per_second": 16.036,
+ "eval_steps_per_second": 2.006,
+ "step": 2980
+ },
+ {
+ "entropy": 0.14479175000451505,
+ "epoch": 7.463262764632628,
+ "grad_norm": 0.2846072018146515,
+ "learning_rate": 4.162601439345814e-05,
+ "loss": 0.07544798254966736,
+ "mean_token_accuracy": 0.9727819666266442,
+ "num_tokens": 6996430.0,
+ "step": 3000
+ },
+ {
+ "epoch": 7.463262764632628,
+ "eval_entropy": 0.2584348309698493,
+ "eval_loss": 0.8253348469734192,
+ "eval_mean_token_accuracy": 0.8511569815319638,
+ "eval_num_tokens": 6996430.0,
+ "eval_runtime": 86.2984,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 3000
+ },
+ {
+ "entropy": 0.14114196319133043,
+ "epoch": 7.51307596513076,
+ "grad_norm": 0.407966285943985,
+ "learning_rate": 4.011432168422419e-05,
+ "loss": 0.0736398994922638,
+ "mean_token_accuracy": 0.9741654269397259,
+ "num_tokens": 7042038.0,
+ "step": 3020
+ },
+ {
+ "epoch": 7.51307596513076,
+ "eval_entropy": 0.25232676260693127,
+ "eval_loss": 0.8296052813529968,
+ "eval_mean_token_accuracy": 0.8523298349491385,
+ "eval_num_tokens": 7042038.0,
+ "eval_runtime": 85.8445,
+ "eval_samples_per_second": 16.017,
+ "eval_steps_per_second": 2.004,
+ "step": 3020
+ },
+ {
+ "entropy": 0.1353456223383546,
+ "epoch": 7.562889165628892,
+ "grad_norm": 0.2712634801864624,
+ "learning_rate": 3.8624652441658684e-05,
+ "loss": 0.07362412214279175,
+ "mean_token_accuracy": 0.9747945807874203,
+ "num_tokens": 7089390.0,
+ "step": 3040
+ },
+ {
+ "epoch": 7.562889165628892,
+ "eval_entropy": 0.2579477243991785,
+ "eval_loss": 0.8274564743041992,
+ "eval_mean_token_accuracy": 0.8517705212498821,
+ "eval_num_tokens": 7089390.0,
+ "eval_runtime": 85.8222,
+ "eval_samples_per_second": 16.022,
+ "eval_steps_per_second": 2.004,
+ "step": 3040
+ },
+ {
+ "entropy": 0.1296080862637609,
+ "epoch": 7.6127023661270234,
+ "grad_norm": 0.2371893972158432,
+ "learning_rate": 3.715745592968707e-05,
+ "loss": 0.06971035599708557,
+ "mean_token_accuracy": 0.9759043246507645,
+ "num_tokens": 7138002.0,
+ "step": 3060
+ },
+ {
+ "epoch": 7.6127023661270234,
+ "eval_entropy": 0.25391967083479083,
+ "eval_loss": 0.8197130560874939,
+ "eval_mean_token_accuracy": 0.8522267875283264,
+ "eval_num_tokens": 7138002.0,
+ "eval_runtime": 85.8796,
+ "eval_samples_per_second": 16.011,
+ "eval_steps_per_second": 2.003,
+ "step": 3060
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 3.0119894630132736e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3080/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3080/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3080/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3080/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3080/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3080/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3080/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3080/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3080/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3080/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3080/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3080/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3080/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3080/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..f1d623a45120bb5099222e99cd62a0df80ecfa99
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3080/trainer_state.json
@@ -0,0 +1,3268 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 7.662515566625156,
+ "eval_steps": 20,
+ "global_step": 3080,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ },
+ {
+ "entropy": 0.3193941755220294,
+ "epoch": 4.5280199252802,
+ "grad_norm": 0.8281906843185425,
+ "learning_rate": 0.0001509111761786888,
+ "loss": 0.23936262130737304,
+ "mean_token_accuracy": 0.9201708927750587,
+ "num_tokens": 4244423.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.5280199252802,
+ "eval_entropy": 0.38704028864239537,
+ "eval_loss": 0.6006569266319275,
+ "eval_mean_token_accuracy": 0.8502406720505205,
+ "eval_num_tokens": 4244423.0,
+ "eval_runtime": 86.8059,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1820
+ },
+ {
+ "entropy": 0.3164879363030195,
+ "epoch": 4.577833125778331,
+ "grad_norm": 0.7892968654632568,
+ "learning_rate": 0.00014905346557909867,
+ "loss": 0.24541733264923096,
+ "mean_token_accuracy": 0.9175932116806507,
+ "num_tokens": 4289773.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.577833125778331,
+ "eval_entropy": 0.38861122120951497,
+ "eval_loss": 0.6115967631340027,
+ "eval_mean_token_accuracy": 0.849471275196519,
+ "eval_num_tokens": 4289773.0,
+ "eval_runtime": 86.2946,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1840
+ },
+ {
+ "entropy": 0.3051785985007882,
+ "epoch": 4.627646326276463,
+ "grad_norm": 0.8109654188156128,
+ "learning_rate": 0.0001471849238862319,
+ "loss": 0.23433220386505127,
+ "mean_token_accuracy": 0.9206570319831371,
+ "num_tokens": 4336894.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.627646326276463,
+ "eval_entropy": 0.37162452295076015,
+ "eval_loss": 0.6184061765670776,
+ "eval_mean_token_accuracy": 0.8501173268223918,
+ "eval_num_tokens": 4336894.0,
+ "eval_runtime": 86.6865,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1860
+ },
+ {
+ "entropy": 0.3168198253959417,
+ "epoch": 4.677459526774595,
+ "grad_norm": 0.9512342214584351,
+ "learning_rate": 0.0001453061146267775,
+ "loss": 0.23832404613494873,
+ "mean_token_accuracy": 0.9197044663131237,
+ "num_tokens": 4382947.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.677459526774595,
+ "eval_entropy": 0.3845940856912801,
+ "eval_loss": 0.606762707233429,
+ "eval_mean_token_accuracy": 0.8504838194957999,
+ "eval_num_tokens": 4382947.0,
+ "eval_runtime": 86.5175,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 1880
+ },
+ {
+ "entropy": 0.30791807882487776,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 0.8123113512992859,
+ "learning_rate": 0.00014341760442398248,
+ "loss": 0.2395785331726074,
+ "mean_token_accuracy": 0.918928150832653,
+ "num_tokens": 4433050.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.7272727272727275,
+ "eval_entropy": 0.39762327222283494,
+ "eval_loss": 0.5994202494621277,
+ "eval_mean_token_accuracy": 0.8509274201337681,
+ "eval_num_tokens": 4433050.0,
+ "eval_runtime": 86.2873,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.993,
+ "step": 1900
+ },
+ {
+ "entropy": 0.3021434534341097,
+ "epoch": 4.777085927770859,
+ "grad_norm": 0.731787383556366,
+ "learning_rate": 0.000141519962826766,
+ "loss": 0.23494718074798585,
+ "mean_token_accuracy": 0.9201403826475143,
+ "num_tokens": 4483598.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.777085927770859,
+ "eval_entropy": 0.3827026732439219,
+ "eval_loss": 0.5995895862579346,
+ "eval_mean_token_accuracy": 0.851468373523202,
+ "eval_num_tokens": 4483598.0,
+ "eval_runtime": 86.3006,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 1920
+ },
+ {
+ "entropy": 0.31626159623265265,
+ "epoch": 4.826899128268991,
+ "grad_norm": 0.8848487138748169,
+ "learning_rate": 0.00013961376213795132,
+ "loss": 0.2439030647277832,
+ "mean_token_accuracy": 0.9196575872600079,
+ "num_tokens": 4529201.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.826899128268991,
+ "eval_entropy": 0.388698436839636,
+ "eval_loss": 0.6000174283981323,
+ "eval_mean_token_accuracy": 0.8518068187458571,
+ "eval_num_tokens": 4529201.0,
+ "eval_runtime": 86.8979,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.979,
+ "step": 1940
+ },
+ {
+ "entropy": 0.30520407035946845,
+ "epoch": 4.876712328767123,
+ "grad_norm": 0.8532460927963257,
+ "learning_rate": 0.00013769957724166695,
+ "loss": 0.23458616733551024,
+ "mean_token_accuracy": 0.9221912942826748,
+ "num_tokens": 4578167.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.876712328767123,
+ "eval_entropy": 0.38777847102908203,
+ "eval_loss": 0.6004981398582458,
+ "eval_mean_token_accuracy": 0.8516481768253238,
+ "eval_num_tokens": 4578167.0,
+ "eval_runtime": 87.0777,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.975,
+ "step": 1960
+ },
+ {
+ "entropy": 0.3226448342204094,
+ "epoch": 4.926525529265255,
+ "grad_norm": 0.6945561766624451,
+ "learning_rate": 0.0001357779854299694,
+ "loss": 0.24048397541046143,
+ "mean_token_accuracy": 0.9195300146937371,
+ "num_tokens": 4622316.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.926525529265255,
+ "eval_entropy": 0.38581624263247777,
+ "eval_loss": 0.6029234528541565,
+ "eval_mean_token_accuracy": 0.8514213260523108,
+ "eval_num_tokens": 4622316.0,
+ "eval_runtime": 85.8729,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 1980
+ },
+ {
+ "entropy": 0.3051655298098922,
+ "epoch": 4.976338729763388,
+ "grad_norm": 0.7976452708244324,
+ "learning_rate": 0.00013384956622874001,
+ "loss": 0.23584742546081544,
+ "mean_token_accuracy": 0.9216851457953453,
+ "num_tokens": 4670746.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.976338729763388,
+ "eval_entropy": 0.37913159246361533,
+ "eval_loss": 0.6057604551315308,
+ "eval_mean_token_accuracy": 0.8525801203971686,
+ "eval_num_tokens": 4670746.0,
+ "eval_runtime": 86.1145,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2000
+ },
+ {
+ "entropy": 0.27438195240803254,
+ "epoch": 5.024906600249066,
+ "grad_norm": 0.6729586124420166,
+ "learning_rate": 0.0001319149012229075,
+ "loss": 0.19775952100753785,
+ "mean_token_accuracy": 0.9339428559327737,
+ "num_tokens": 4716176.0,
+ "step": 2020
+ },
+ {
+ "epoch": 5.024906600249066,
+ "eval_entropy": 0.3448961910813354,
+ "eval_loss": 0.6750120520591736,
+ "eval_mean_token_accuracy": 0.8487970232963562,
+ "eval_num_tokens": 4716176.0,
+ "eval_runtime": 86.1169,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2020
+ },
+ {
+ "entropy": 0.21423916313797237,
+ "epoch": 5.074719800747198,
+ "grad_norm": 0.6934391856193542,
+ "learning_rate": 0.00012997457388105022,
+ "loss": 0.1439570426940918,
+ "mean_token_accuracy": 0.9528236843645572,
+ "num_tokens": 4763269.0,
+ "step": 2040
+ },
+ {
+ "epoch": 5.074719800747198,
+ "eval_entropy": 0.3570949243771475,
+ "eval_loss": 0.6465504169464111,
+ "eval_mean_token_accuracy": 0.8490785547467166,
+ "eval_num_tokens": 4763269.0,
+ "eval_runtime": 85.9574,
+ "eval_samples_per_second": 15.996,
+ "eval_steps_per_second": 2.001,
+ "step": 2040
+ },
+ {
+ "entropy": 0.20838565267622472,
+ "epoch": 5.12453300124533,
+ "grad_norm": 0.7286986112594604,
+ "learning_rate": 0.00012802916937942972,
+ "loss": 0.14467307329177856,
+ "mean_token_accuracy": 0.950994835793972,
+ "num_tokens": 4809047.0,
+ "step": 2060
+ },
+ {
+ "epoch": 5.12453300124533,
+ "eval_entropy": 0.3452463157821533,
+ "eval_loss": 0.6705958843231201,
+ "eval_mean_token_accuracy": 0.8490352796953778,
+ "eval_num_tokens": 4809047.0,
+ "eval_runtime": 86.228,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 2060
+ },
+ {
+ "entropy": 0.20453082229942082,
+ "epoch": 5.174346201743462,
+ "grad_norm": 0.7515555620193481,
+ "learning_rate": 0.00012607927442550974,
+ "loss": 0.13732000589370727,
+ "mean_token_accuracy": 0.9537357829511166,
+ "num_tokens": 4857965.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.174346201743462,
+ "eval_entropy": 0.32431264914745506,
+ "eval_loss": 0.6743043065071106,
+ "eval_mean_token_accuracy": 0.8504878629085629,
+ "eval_num_tokens": 4857965.0,
+ "eval_runtime": 86.5948,
+ "eval_samples_per_second": 15.879,
+ "eval_steps_per_second": 1.986,
+ "step": 2080
+ },
+ {
+ "entropy": 0.21812320686876774,
+ "epoch": 5.224159402241594,
+ "grad_norm": 0.9093465209007263,
+ "learning_rate": 0.0001241254770810132,
+ "loss": 0.14311420917510986,
+ "mean_token_accuracy": 0.9514068141579628,
+ "num_tokens": 4905151.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.224159402241594,
+ "eval_entropy": 0.33086285835435225,
+ "eval_loss": 0.6676449179649353,
+ "eval_mean_token_accuracy": 0.8505287662495015,
+ "eval_num_tokens": 4905151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 2100
+ },
+ {
+ "entropy": 0.2180163251236081,
+ "epoch": 5.273972602739726,
+ "grad_norm": 0.6703007221221924,
+ "learning_rate": 0.00012216836658457075,
+ "loss": 0.14803968667984008,
+ "mean_token_accuracy": 0.9521303348243236,
+ "num_tokens": 4947072.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.273972602739726,
+ "eval_entropy": 0.33162341708707255,
+ "eval_loss": 0.6658875942230225,
+ "eval_mean_token_accuracy": 0.8500757605530495,
+ "eval_num_tokens": 4947072.0,
+ "eval_runtime": 86.6296,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 2120
+ },
+ {
+ "entropy": 0.22511130161583423,
+ "epoch": 5.323785803237858,
+ "grad_norm": 0.8078880906105042,
+ "learning_rate": 0.00012020853317401455,
+ "loss": 0.15228408575057983,
+ "mean_token_accuracy": 0.947144789993763,
+ "num_tokens": 4991974.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.323785803237858,
+ "eval_entropy": 0.3354601170434508,
+ "eval_loss": 0.6677829623222351,
+ "eval_mean_token_accuracy": 0.8482600024273229,
+ "eval_num_tokens": 4991974.0,
+ "eval_runtime": 86.4689,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.989,
+ "step": 2140
+ },
+ {
+ "entropy": 0.2244176059961319,
+ "epoch": 5.37359900373599,
+ "grad_norm": 0.9636075496673584,
+ "learning_rate": 0.00011824656790837037,
+ "loss": 0.15260883569717407,
+ "mean_token_accuracy": 0.9471467643976211,
+ "num_tokens": 5038400.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.37359900373599,
+ "eval_entropy": 0.3381616926297199,
+ "eval_loss": 0.6694412231445312,
+ "eval_mean_token_accuracy": 0.8482369603805764,
+ "eval_num_tokens": 5038400.0,
+ "eval_runtime": 86.4147,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 2160
+ },
+ {
+ "entropy": 0.22982364390045404,
+ "epoch": 5.423412204234122,
+ "grad_norm": 0.775401771068573,
+ "learning_rate": 0.00011628306248960262,
+ "loss": 0.15140302181243898,
+ "mean_token_accuracy": 0.9492553934454918,
+ "num_tokens": 5083166.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.423412204234122,
+ "eval_entropy": 0.3305150235808173,
+ "eval_loss": 0.6717822551727295,
+ "eval_mean_token_accuracy": 0.8489849723355715,
+ "eval_num_tokens": 5083166.0,
+ "eval_runtime": 86.4728,
+ "eval_samples_per_second": 15.901,
+ "eval_steps_per_second": 1.989,
+ "step": 2180
+ },
+ {
+ "entropy": 0.21448935717344284,
+ "epoch": 5.473225404732254,
+ "grad_norm": 0.6575281023979187,
+ "learning_rate": 0.00011431860908416465,
+ "loss": 0.1452319622039795,
+ "mean_token_accuracy": 0.9505287684500218,
+ "num_tokens": 5135109.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.473225404732254,
+ "eval_entropy": 0.3488145174328671,
+ "eval_loss": 0.6612305641174316,
+ "eval_mean_token_accuracy": 0.8492907808963642,
+ "eval_num_tokens": 5135109.0,
+ "eval_runtime": 86.6927,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 2200
+ },
+ {
+ "entropy": 0.23091202937066554,
+ "epoch": 5.523038605230386,
+ "grad_norm": 0.8909686207771301,
+ "learning_rate": 0.00011235380014440985,
+ "loss": 0.15150139331817628,
+ "mean_token_accuracy": 0.9497875183820724,
+ "num_tokens": 5180138.0,
+ "step": 2220
+ },
+ {
+ "epoch": 5.523038605230386,
+ "eval_entropy": 0.3268539015810157,
+ "eval_loss": 0.6667542457580566,
+ "eval_mean_token_accuracy": 0.8499062903398691,
+ "eval_num_tokens": 5180138.0,
+ "eval_runtime": 86.4644,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 2220
+ },
+ {
+ "entropy": 0.2227974807843566,
+ "epoch": 5.572851805728518,
+ "grad_norm": 0.6180275082588196,
+ "learning_rate": 0.0001103892282299158,
+ "loss": 0.1491069197654724,
+ "mean_token_accuracy": 0.9488144010305405,
+ "num_tokens": 5226864.0,
+ "step": 2240
+ },
+ {
+ "epoch": 5.572851805728518,
+ "eval_entropy": 0.3346347655494546,
+ "eval_loss": 0.6665948629379272,
+ "eval_mean_token_accuracy": 0.8499961893918903,
+ "eval_num_tokens": 5226864.0,
+ "eval_runtime": 87.0548,
+ "eval_samples_per_second": 15.795,
+ "eval_steps_per_second": 1.976,
+ "step": 2240
+ },
+ {
+ "entropy": 0.21368421968072654,
+ "epoch": 5.62266500622665,
+ "grad_norm": 0.6004369258880615,
+ "learning_rate": 0.00010842548582877651,
+ "loss": 0.14485255479812623,
+ "mean_token_accuracy": 0.9502056457102299,
+ "num_tokens": 5276602.0,
+ "step": 2260
+ },
+ {
+ "epoch": 5.62266500622665,
+ "eval_entropy": 0.32753298804163933,
+ "eval_loss": 0.6680151224136353,
+ "eval_mean_token_accuracy": 0.8515451086121936,
+ "eval_num_tokens": 5276602.0,
+ "eval_runtime": 86.8524,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.98,
+ "step": 2260
+ },
+ {
+ "entropy": 0.2103635374456644,
+ "epoch": 5.672478206724782,
+ "grad_norm": 0.699174702167511,
+ "learning_rate": 0.00010646316517891613,
+ "loss": 0.14297772645950318,
+ "mean_token_accuracy": 0.9512537539005279,
+ "num_tokens": 5323718.0,
+ "step": 2280
+ },
+ {
+ "epoch": 5.672478206724782,
+ "eval_entropy": 0.32966585959806,
+ "eval_loss": 0.675578773021698,
+ "eval_mean_token_accuracy": 0.8509623023659684,
+ "eval_num_tokens": 5323718.0,
+ "eval_runtime": 86.4518,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2280
+ },
+ {
+ "entropy": 0.22516900151968003,
+ "epoch": 5.722291407222914,
+ "grad_norm": 0.6637354493141174,
+ "learning_rate": 0.00010450285808947797,
+ "loss": 0.15202572345733642,
+ "mean_token_accuracy": 0.9482452072203159,
+ "num_tokens": 5369039.0,
+ "step": 2300
+ },
+ {
+ "epoch": 5.722291407222914,
+ "eval_entropy": 0.3369456917740578,
+ "eval_loss": 0.6697061061859131,
+ "eval_mean_token_accuracy": 0.848603522361711,
+ "eval_num_tokens": 5369039.0,
+ "eval_runtime": 86.6371,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.985,
+ "step": 2300
+ },
+ {
+ "entropy": 0.21841065725311637,
+ "epoch": 5.772104607721046,
+ "grad_norm": 0.7940268516540527,
+ "learning_rate": 0.00010254515576234297,
+ "loss": 0.14710167646408082,
+ "mean_token_accuracy": 0.9493498183786869,
+ "num_tokens": 5417029.0,
+ "step": 2320
+ },
+ {
+ "epoch": 5.772104607721046,
+ "eval_entropy": 0.3237486180177955,
+ "eval_loss": 0.6779657602310181,
+ "eval_mean_token_accuracy": 0.8500715313955794,
+ "eval_num_tokens": 5417029.0,
+ "eval_runtime": 86.1826,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 1.996,
+ "step": 2320
+ },
+ {
+ "entropy": 0.22146204356104135,
+ "epoch": 5.821917808219178,
+ "grad_norm": 0.9234833121299744,
+ "learning_rate": 0.00010059064861383132,
+ "loss": 0.14720046520233154,
+ "mean_token_accuracy": 0.9493872679769992,
+ "num_tokens": 5461671.0,
+ "step": 2340
+ },
+ {
+ "epoch": 5.821917808219178,
+ "eval_entropy": 0.32365207564692167,
+ "eval_loss": 0.6704005002975464,
+ "eval_mean_token_accuracy": 0.8507985760306203,
+ "eval_num_tokens": 5461671.0,
+ "eval_runtime": 86.5494,
+ "eval_samples_per_second": 15.887,
+ "eval_steps_per_second": 1.987,
+ "step": 2340
+ },
+ {
+ "entropy": 0.20934011954814197,
+ "epoch": 5.87173100871731,
+ "grad_norm": 0.5547503232955933,
+ "learning_rate": 9.863992609664084e-05,
+ "loss": 0.1464867353439331,
+ "mean_token_accuracy": 0.9503875687718392,
+ "num_tokens": 5509312.0,
+ "step": 2360
+ },
+ {
+ "epoch": 5.87173100871731,
+ "eval_entropy": 0.3330401429083458,
+ "eval_loss": 0.6659091114997864,
+ "eval_mean_token_accuracy": 0.8504848906467127,
+ "eval_num_tokens": 5509312.0,
+ "eval_runtime": 86.5855,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 2360
+ },
+ {
+ "entropy": 0.21678635366261007,
+ "epoch": 5.921544209215442,
+ "grad_norm": 0.570612907409668,
+ "learning_rate": 9.669357652207635e-05,
+ "loss": 0.14821385145187377,
+ "mean_token_accuracy": 0.9503940217196941,
+ "num_tokens": 5558196.0,
+ "step": 2380
+ },
+ {
+ "epoch": 5.921544209215442,
+ "eval_entropy": 0.3322022325077722,
+ "eval_loss": 0.6722489595413208,
+ "eval_mean_token_accuracy": 0.8489979422369669,
+ "eval_num_tokens": 5558196.0,
+ "eval_runtime": 86.2986,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 2380
+ },
+ {
+ "entropy": 0.20932920072227718,
+ "epoch": 5.971357409713574,
+ "grad_norm": 0.7879557609558105,
+ "learning_rate": 9.475218688262262e-05,
+ "loss": 0.14675841331481934,
+ "mean_token_accuracy": 0.9507176131010056,
+ "num_tokens": 5605400.0,
+ "step": 2400
+ },
+ {
+ "epoch": 5.971357409713574,
+ "eval_entropy": 0.3199348642902319,
+ "eval_loss": 0.6698136329650879,
+ "eval_mean_token_accuracy": 0.8514142130003419,
+ "eval_num_tokens": 5605400.0,
+ "eval_runtime": 85.8995,
+ "eval_samples_per_second": 16.007,
+ "eval_steps_per_second": 2.002,
+ "step": 2400
+ },
+ {
+ "entropy": 0.21032143919131693,
+ "epoch": 6.019925280199253,
+ "grad_norm": 0.5823076367378235,
+ "learning_rate": 9.281634267491569e-05,
+ "loss": 0.13322267532348633,
+ "mean_token_accuracy": 0.9550939072401096,
+ "num_tokens": 5648968.0,
+ "step": 2420
+ },
+ {
+ "epoch": 6.019925280199253,
+ "eval_entropy": 0.30206270117399303,
+ "eval_loss": 0.7093168497085571,
+ "eval_mean_token_accuracy": 0.8500627639681794,
+ "eval_num_tokens": 5648968.0,
+ "eval_runtime": 85.8128,
+ "eval_samples_per_second": 16.023,
+ "eval_steps_per_second": 2.004,
+ "step": 2420
+ },
+ {
+ "entropy": 0.1534628233872354,
+ "epoch": 6.069738480697385,
+ "grad_norm": 0.710133969783783,
+ "learning_rate": 9.088662772316508e-05,
+ "loss": 0.09078952670097351,
+ "mean_token_accuracy": 0.9678447999060154,
+ "num_tokens": 5697633.0,
+ "step": 2440
+ },
+ {
+ "epoch": 6.069738480697385,
+ "eval_entropy": 0.28208133101809857,
+ "eval_loss": 0.7636417150497437,
+ "eval_mean_token_accuracy": 0.8494061477655588,
+ "eval_num_tokens": 5697633.0,
+ "eval_runtime": 85.9724,
+ "eval_samples_per_second": 15.994,
+ "eval_steps_per_second": 2.001,
+ "step": 2440
+ },
+ {
+ "entropy": 0.16151462448760867,
+ "epoch": 6.119551681195516,
+ "grad_norm": 0.5793812274932861,
+ "learning_rate": 8.896362400308028e-05,
+ "loss": 0.09545697569847107,
+ "mean_token_accuracy": 0.9671573750674725,
+ "num_tokens": 5745090.0,
+ "step": 2460
+ },
+ {
+ "epoch": 6.119551681195516,
+ "eval_entropy": 0.2833245605403601,
+ "eval_loss": 0.7402405738830566,
+ "eval_mean_token_accuracy": 0.8503523728875226,
+ "eval_num_tokens": 5745090.0,
+ "eval_runtime": 85.5461,
+ "eval_samples_per_second": 16.073,
+ "eval_steps_per_second": 2.011,
+ "step": 2460
+ },
+ {
+ "entropy": 0.15203177919611335,
+ "epoch": 6.169364881693649,
+ "grad_norm": 0.4251123368740082,
+ "learning_rate": 8.704791146635483e-05,
+ "loss": 0.09420782327651978,
+ "mean_token_accuracy": 0.9677386932075024,
+ "num_tokens": 5790333.0,
+ "step": 2480
+ },
+ {
+ "epoch": 6.169364881693649,
+ "eval_entropy": 0.28572545962971313,
+ "eval_loss": 0.735416829586029,
+ "eval_mean_token_accuracy": 0.8487084663884584,
+ "eval_num_tokens": 5790333.0,
+ "eval_runtime": 85.4801,
+ "eval_samples_per_second": 16.086,
+ "eval_steps_per_second": 2.012,
+ "step": 2480
+ },
+ {
+ "entropy": 0.15587336672469973,
+ "epoch": 6.219178082191781,
+ "grad_norm": 0.4357028007507324,
+ "learning_rate": 8.514006786576085e-05,
+ "loss": 0.09429320096969604,
+ "mean_token_accuracy": 0.9682952925562859,
+ "num_tokens": 5837321.0,
+ "step": 2500
+ },
+ {
+ "epoch": 6.219178082191781,
+ "eval_entropy": 0.2859006894882335,
+ "eval_loss": 0.7347224950790405,
+ "eval_mean_token_accuracy": 0.8501905518215757,
+ "eval_num_tokens": 5837321.0,
+ "eval_runtime": 85.7578,
+ "eval_samples_per_second": 16.034,
+ "eval_steps_per_second": 2.006,
+ "step": 2500
+ },
+ {
+ "entropy": 0.15765639198943973,
+ "epoch": 6.268991282689913,
+ "grad_norm": 0.47331130504608154,
+ "learning_rate": 8.324066858090663e-05,
+ "loss": 0.09571113586425781,
+ "mean_token_accuracy": 0.9683481335639954,
+ "num_tokens": 5884398.0,
+ "step": 2520
+ },
+ {
+ "epoch": 6.268991282689913,
+ "eval_entropy": 0.29231513846059176,
+ "eval_loss": 0.7392512559890747,
+ "eval_mean_token_accuracy": 0.8486633983462356,
+ "eval_num_tokens": 5884398.0,
+ "eval_runtime": 85.7846,
+ "eval_samples_per_second": 16.029,
+ "eval_steps_per_second": 2.005,
+ "step": 2520
+ },
+ {
+ "entropy": 0.16176860257983208,
+ "epoch": 6.318804483188045,
+ "grad_norm": 0.6142018437385559,
+ "learning_rate": 8.135028644470992e-05,
+ "loss": 0.09486144185066223,
+ "mean_token_accuracy": 0.9682316601276397,
+ "num_tokens": 5929876.0,
+ "step": 2540
+ },
+ {
+ "epoch": 6.318804483188045,
+ "eval_entropy": 0.2851274753379267,
+ "eval_loss": 0.7520816922187805,
+ "eval_mean_token_accuracy": 0.8501113649717597,
+ "eval_num_tokens": 5929876.0,
+ "eval_runtime": 85.9425,
+ "eval_samples_per_second": 15.999,
+ "eval_steps_per_second": 2.001,
+ "step": 2540
+ },
+ {
+ "entropy": 0.15404034564271568,
+ "epoch": 6.3686176836861765,
+ "grad_norm": 0.6051287651062012,
+ "learning_rate": 7.946949157063964e-05,
+ "loss": 0.09280472993850708,
+ "mean_token_accuracy": 0.9684635892510414,
+ "num_tokens": 5978490.0,
+ "step": 2560
+ },
+ {
+ "epoch": 6.3686176836861765,
+ "eval_entropy": 0.28802703563557114,
+ "eval_loss": 0.7439162135124207,
+ "eval_mean_token_accuracy": 0.8499851770872293,
+ "eval_num_tokens": 5978490.0,
+ "eval_runtime": 86.0703,
+ "eval_samples_per_second": 15.975,
+ "eval_steps_per_second": 1.998,
+ "step": 2560
+ },
+ {
+ "entropy": 0.15343588953837753,
+ "epoch": 6.418430884184309,
+ "grad_norm": 0.4823743402957916,
+ "learning_rate": 7.759885118077701e-05,
+ "loss": 0.09000591039657593,
+ "mean_token_accuracy": 0.9699928767979145,
+ "num_tokens": 6025380.0,
+ "step": 2580
+ },
+ {
+ "epoch": 6.418430884184309,
+ "eval_entropy": 0.2795634938533916,
+ "eval_loss": 0.7647850513458252,
+ "eval_mean_token_accuracy": 0.8503464397995971,
+ "eval_num_tokens": 6025380.0,
+ "eval_runtime": 85.8886,
+ "eval_samples_per_second": 16.009,
+ "eval_steps_per_second": 2.003,
+ "step": 2580
+ },
+ {
+ "entropy": 0.15740026142448188,
+ "epoch": 6.468244084682441,
+ "grad_norm": 0.5082696676254272,
+ "learning_rate": 7.57389294347494e-05,
+ "loss": 0.09191849827766418,
+ "mean_token_accuracy": 0.9692809768021107,
+ "num_tokens": 6073349.0,
+ "step": 2600
+ },
+ {
+ "epoch": 6.468244084682441,
+ "eval_entropy": 0.2913342311458532,
+ "eval_loss": 0.7518694996833801,
+ "eval_mean_token_accuracy": 0.8483168302580367,
+ "eval_num_tokens": 6073349.0,
+ "eval_runtime": 85.5761,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.01,
+ "step": 2600
+ },
+ {
+ "entropy": 0.15922069251537324,
+ "epoch": 6.518057285180573,
+ "grad_norm": 0.3995199501514435,
+ "learning_rate": 7.389028725958736e-05,
+ "loss": 0.09584367871284485,
+ "mean_token_accuracy": 0.9685114495456218,
+ "num_tokens": 6118148.0,
+ "step": 2620
+ },
+ {
+ "epoch": 6.518057285180573,
+ "eval_entropy": 0.2863075934177221,
+ "eval_loss": 0.7539381384849548,
+ "eval_mean_token_accuracy": 0.8507507083027862,
+ "eval_num_tokens": 6118148.0,
+ "eval_runtime": 86.112,
+ "eval_samples_per_second": 15.968,
+ "eval_steps_per_second": 1.997,
+ "step": 2620
+ },
+ {
+ "entropy": 0.16197575423866512,
+ "epoch": 6.567870485678705,
+ "grad_norm": 0.534295380115509,
+ "learning_rate": 7.205348218055678e-05,
+ "loss": 0.0961170256137848,
+ "mean_token_accuracy": 0.9674530044198036,
+ "num_tokens": 6165523.0,
+ "step": 2640
+ },
+ {
+ "epoch": 6.567870485678705,
+ "eval_entropy": 0.29021967315050057,
+ "eval_loss": 0.751198947429657,
+ "eval_mean_token_accuracy": 0.8509796344956686,
+ "eval_num_tokens": 6165523.0,
+ "eval_runtime": 85.7958,
+ "eval_samples_per_second": 16.026,
+ "eval_steps_per_second": 2.005,
+ "step": 2640
+ },
+ {
+ "entropy": 0.15261746793985367,
+ "epoch": 6.617683686176837,
+ "grad_norm": 0.5391237139701843,
+ "learning_rate": 7.022906815301673e-05,
+ "loss": 0.0926026999950409,
+ "mean_token_accuracy": 0.9695659473538398,
+ "num_tokens": 6216232.0,
+ "step": 2660
+ },
+ {
+ "epoch": 6.617683686176837,
+ "eval_entropy": 0.29128045216202736,
+ "eval_loss": 0.7450292110443115,
+ "eval_mean_token_accuracy": 0.8498771443616512,
+ "eval_num_tokens": 6216232.0,
+ "eval_runtime": 86.3963,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 2660
+ },
+ {
+ "entropy": 0.16164180357009172,
+ "epoch": 6.667496886674969,
+ "grad_norm": 0.5767946243286133,
+ "learning_rate": 6.841759539535419e-05,
+ "loss": 0.09291981458663941,
+ "mean_token_accuracy": 0.9687136687338352,
+ "num_tokens": 6264807.0,
+ "step": 2680
+ },
+ {
+ "epoch": 6.667496886674969,
+ "eval_entropy": 0.2897637223088464,
+ "eval_loss": 0.7503410577774048,
+ "eval_mean_token_accuracy": 0.8503315164599308,
+ "eval_num_tokens": 6264807.0,
+ "eval_runtime": 86.0653,
+ "eval_samples_per_second": 15.976,
+ "eval_steps_per_second": 1.998,
+ "step": 2680
+ },
+ {
+ "entropy": 0.17062523355707526,
+ "epoch": 6.717310087173101,
+ "grad_norm": 0.4974168539047241,
+ "learning_rate": 6.661961022304563e-05,
+ "loss": 0.09713236689567566,
+ "mean_token_accuracy": 0.9661971725523472,
+ "num_tokens": 6308819.0,
+ "step": 2700
+ },
+ {
+ "epoch": 6.717310087173101,
+ "eval_entropy": 0.2765843396963075,
+ "eval_loss": 0.7604002356529236,
+ "eval_mean_token_accuracy": 0.8521115277395692,
+ "eval_num_tokens": 6308819.0,
+ "eval_runtime": 86.1676,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 2700
+ },
+ {
+ "entropy": 0.17544092936441302,
+ "epoch": 6.767123287671232,
+ "grad_norm": 0.5523537993431091,
+ "learning_rate": 6.483565488389582e-05,
+ "loss": 0.09709116220474243,
+ "mean_token_accuracy": 0.9650957375764847,
+ "num_tokens": 6352548.0,
+ "step": 2720
+ },
+ {
+ "epoch": 6.767123287671232,
+ "eval_entropy": 0.27939334659035814,
+ "eval_loss": 0.7534670829772949,
+ "eval_mean_token_accuracy": 0.851230604010959,
+ "eval_num_tokens": 6352548.0,
+ "eval_runtime": 86.2913,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 2720
+ },
+ {
+ "entropy": 0.15991022661328316,
+ "epoch": 6.816936488169365,
+ "grad_norm": 0.478551983833313,
+ "learning_rate": 6.306626739450311e-05,
+ "loss": 0.09564646482467651,
+ "mean_token_accuracy": 0.9679084822535515,
+ "num_tokens": 6397720.0,
+ "step": 2740
+ },
+ {
+ "epoch": 6.816936488169365,
+ "eval_entropy": 0.27878295491601146,
+ "eval_loss": 0.7519959211349487,
+ "eval_mean_token_accuracy": 0.8510654949864676,
+ "eval_num_tokens": 6397720.0,
+ "eval_runtime": 85.9109,
+ "eval_samples_per_second": 16.005,
+ "eval_steps_per_second": 2.002,
+ "step": 2740
+ },
+ {
+ "entropy": 0.16824879590421915,
+ "epoch": 6.866749688667497,
+ "grad_norm": 0.6681098937988281,
+ "learning_rate": 6.131198137800108e-05,
+ "loss": 0.0962279736995697,
+ "mean_token_accuracy": 0.966830012947321,
+ "num_tokens": 6442821.0,
+ "step": 2760
+ },
+ {
+ "epoch": 6.866749688667497,
+ "eval_entropy": 0.2834690434121808,
+ "eval_loss": 0.751922070980072,
+ "eval_mean_token_accuracy": 0.8521237577809844,
+ "eval_num_tokens": 6442821.0,
+ "eval_runtime": 86.3618,
+ "eval_samples_per_second": 15.921,
+ "eval_steps_per_second": 1.992,
+ "step": 2760
+ },
+ {
+ "entropy": 0.1518704930320382,
+ "epoch": 6.916562889165629,
+ "grad_norm": 0.5201290249824524,
+ "learning_rate": 5.957332590312513e-05,
+ "loss": 0.09010660648345947,
+ "mean_token_accuracy": 0.9693463340401649,
+ "num_tokens": 6494118.0,
+ "step": 2780
+ },
+ {
+ "epoch": 6.916562889165629,
+ "eval_entropy": 0.28485129617674404,
+ "eval_loss": 0.7452457547187805,
+ "eval_mean_token_accuracy": 0.8512036796919135,
+ "eval_num_tokens": 6494118.0,
+ "eval_runtime": 86.4524,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2780
+ },
+ {
+ "entropy": 0.15512610590085388,
+ "epoch": 6.966376089663761,
+ "grad_norm": 0.42802050709724426,
+ "learning_rate": 5.785082532465233e-05,
+ "loss": 0.09320432543754578,
+ "mean_token_accuracy": 0.9686134628951549,
+ "num_tokens": 6540175.0,
+ "step": 2800
+ },
+ {
+ "epoch": 6.966376089663761,
+ "eval_entropy": 0.27554594526110693,
+ "eval_loss": 0.7644653916358948,
+ "eval_mean_token_accuracy": 0.8513738523389018,
+ "eval_num_tokens": 6540175.0,
+ "eval_runtime": 85.7609,
+ "eval_samples_per_second": 16.033,
+ "eval_steps_per_second": 2.006,
+ "step": 2800
+ },
+ {
+ "entropy": 0.17524497526196334,
+ "epoch": 7.01494396014944,
+ "grad_norm": 0.3330269157886505,
+ "learning_rate": 5.6144999125263545e-05,
+ "loss": 0.0895616888999939,
+ "mean_token_accuracy": 0.9682766932707566,
+ "num_tokens": 6583767.0,
+ "step": 2820
+ },
+ {
+ "epoch": 7.01494396014944,
+ "eval_entropy": 0.2735865569218647,
+ "eval_loss": 0.768479585647583,
+ "eval_mean_token_accuracy": 0.8503459383581959,
+ "eval_num_tokens": 6583767.0,
+ "eval_runtime": 85.7162,
+ "eval_samples_per_second": 16.041,
+ "eval_steps_per_second": 2.007,
+ "step": 2820
+ },
+ {
+ "entropy": 0.1403565663844347,
+ "epoch": 7.064757160647572,
+ "grad_norm": 0.35613498091697693,
+ "learning_rate": 5.4456361758874235e-05,
+ "loss": 0.07551313638687134,
+ "mean_token_accuracy": 0.9739301167428493,
+ "num_tokens": 6627672.0,
+ "step": 2840
+ },
+ {
+ "epoch": 7.064757160647572,
+ "eval_entropy": 0.25941789089593775,
+ "eval_loss": 0.8209511637687683,
+ "eval_mean_token_accuracy": 0.8505055855873019,
+ "eval_num_tokens": 6627672.0,
+ "eval_runtime": 86.0943,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 2840
+ },
+ {
+ "entropy": 0.13500106502324344,
+ "epoch": 7.114570361145703,
+ "grad_norm": 0.34418627619743347,
+ "learning_rate": 5.2785422495482234e-05,
+ "loss": 0.07293946146965027,
+ "mean_token_accuracy": 0.9747208289802074,
+ "num_tokens": 6672946.0,
+ "step": 2860
+ },
+ {
+ "epoch": 7.114570361145703,
+ "eval_entropy": 0.26482899772912954,
+ "eval_loss": 0.798904538154602,
+ "eval_mean_token_accuracy": 0.8511530233677044,
+ "eval_num_tokens": 6672946.0,
+ "eval_runtime": 85.7915,
+ "eval_samples_per_second": 16.027,
+ "eval_steps_per_second": 2.005,
+ "step": 2860
+ },
+ {
+ "entropy": 0.13127502552233636,
+ "epoch": 7.164383561643835,
+ "grad_norm": 0.4638441503047943,
+ "learning_rate": 5.113268526757892e-05,
+ "loss": 0.07121461629867554,
+ "mean_token_accuracy": 0.9756786689162255,
+ "num_tokens": 6718582.0,
+ "step": 2880
+ },
+ {
+ "epoch": 7.164383561643835,
+ "eval_entropy": 0.2645381211714689,
+ "eval_loss": 0.809101939201355,
+ "eval_mean_token_accuracy": 0.8514727898115335,
+ "eval_num_tokens": 6718582.0,
+ "eval_runtime": 85.84,
+ "eval_samples_per_second": 16.018,
+ "eval_steps_per_second": 2.004,
+ "step": 2880
+ },
+ {
+ "entropy": 0.1331390908919275,
+ "epoch": 7.214196762141968,
+ "grad_norm": 0.40206775069236755,
+ "learning_rate": 4.949864851817007e-05,
+ "loss": 0.07188264131546021,
+ "mean_token_accuracy": 0.9755406074225903,
+ "num_tokens": 6764387.0,
+ "step": 2900
+ },
+ {
+ "epoch": 7.214196762141968,
+ "eval_entropy": 0.26244733283339544,
+ "eval_loss": 0.8143188953399658,
+ "eval_mean_token_accuracy": 0.8514358189909957,
+ "eval_num_tokens": 6764387.0,
+ "eval_runtime": 85.8546,
+ "eval_samples_per_second": 16.015,
+ "eval_steps_per_second": 2.003,
+ "step": 2900
+ },
+ {
+ "entropy": 0.13647331558167936,
+ "epoch": 7.2640099626401,
+ "grad_norm": 0.26405787467956543,
+ "learning_rate": 4.788380505045224e-05,
+ "loss": 0.07412450313568116,
+ "mean_token_accuracy": 0.9744274213910102,
+ "num_tokens": 6809678.0,
+ "step": 2920
+ },
+ {
+ "epoch": 7.2640099626401,
+ "eval_entropy": 0.2626111418182074,
+ "eval_loss": 0.8111525177955627,
+ "eval_mean_token_accuracy": 0.8512121695418691,
+ "eval_num_tokens": 6809678.0,
+ "eval_runtime": 85.9626,
+ "eval_samples_per_second": 15.995,
+ "eval_steps_per_second": 2.001,
+ "step": 2920
+ },
+ {
+ "entropy": 0.12644002586603165,
+ "epoch": 7.313823163138232,
+ "grad_norm": 0.27514681220054626,
+ "learning_rate": 4.6288641879189884e-05,
+ "loss": 0.06807711124420165,
+ "mean_token_accuracy": 0.9760703906416893,
+ "num_tokens": 6860750.0,
+ "step": 2940
+ },
+ {
+ "epoch": 7.313823163138232,
+ "eval_entropy": 0.26096762734097106,
+ "eval_loss": 0.8184595108032227,
+ "eval_mean_token_accuracy": 0.8501476153384807,
+ "eval_num_tokens": 6860750.0,
+ "eval_runtime": 85.9521,
+ "eval_samples_per_second": 15.997,
+ "eval_steps_per_second": 2.001,
+ "step": 2940
+ },
+ {
+ "entropy": 0.13920630998909472,
+ "epoch": 7.363636363636363,
+ "grad_norm": 0.23584705591201782,
+ "learning_rate": 4.4713640083838604e-05,
+ "loss": 0.07301607131958007,
+ "mean_token_accuracy": 0.9745715200901032,
+ "num_tokens": 6907092.0,
+ "step": 2960
+ },
+ {
+ "epoch": 7.363636363636363,
+ "eval_entropy": 0.2612536767021168,
+ "eval_loss": 0.8116245269775391,
+ "eval_mean_token_accuracy": 0.8510967350976412,
+ "eval_num_tokens": 6907092.0,
+ "eval_runtime": 85.6373,
+ "eval_samples_per_second": 16.056,
+ "eval_steps_per_second": 2.008,
+ "step": 2960
+ },
+ {
+ "entropy": 0.1349492883309722,
+ "epoch": 7.4134495641344955,
+ "grad_norm": 0.24552719295024872,
+ "learning_rate": 4.315927466345791e-05,
+ "loss": 0.07397544980049134,
+ "mean_token_accuracy": 0.9745095103979111,
+ "num_tokens": 6952700.0,
+ "step": 2980
+ },
+ {
+ "epoch": 7.4134495641344955,
+ "eval_entropy": 0.25796533306670744,
+ "eval_loss": 0.8266491293907166,
+ "eval_mean_token_accuracy": 0.8511653857868772,
+ "eval_num_tokens": 6952700.0,
+ "eval_runtime": 85.7462,
+ "eval_samples_per_second": 16.036,
+ "eval_steps_per_second": 2.006,
+ "step": 2980
+ },
+ {
+ "entropy": 0.14479175000451505,
+ "epoch": 7.463262764632628,
+ "grad_norm": 0.2846072018146515,
+ "learning_rate": 4.162601439345814e-05,
+ "loss": 0.07544798254966736,
+ "mean_token_accuracy": 0.9727819666266442,
+ "num_tokens": 6996430.0,
+ "step": 3000
+ },
+ {
+ "epoch": 7.463262764632628,
+ "eval_entropy": 0.2584348309698493,
+ "eval_loss": 0.8253348469734192,
+ "eval_mean_token_accuracy": 0.8511569815319638,
+ "eval_num_tokens": 6996430.0,
+ "eval_runtime": 86.2984,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 3000
+ },
+ {
+ "entropy": 0.14114196319133043,
+ "epoch": 7.51307596513076,
+ "grad_norm": 0.407966285943985,
+ "learning_rate": 4.011432168422419e-05,
+ "loss": 0.0736398994922638,
+ "mean_token_accuracy": 0.9741654269397259,
+ "num_tokens": 7042038.0,
+ "step": 3020
+ },
+ {
+ "epoch": 7.51307596513076,
+ "eval_entropy": 0.25232676260693127,
+ "eval_loss": 0.8296052813529968,
+ "eval_mean_token_accuracy": 0.8523298349491385,
+ "eval_num_tokens": 7042038.0,
+ "eval_runtime": 85.8445,
+ "eval_samples_per_second": 16.017,
+ "eval_steps_per_second": 2.004,
+ "step": 3020
+ },
+ {
+ "entropy": 0.1353456223383546,
+ "epoch": 7.562889165628892,
+ "grad_norm": 0.2712634801864624,
+ "learning_rate": 3.8624652441658684e-05,
+ "loss": 0.07362412214279175,
+ "mean_token_accuracy": 0.9747945807874203,
+ "num_tokens": 7089390.0,
+ "step": 3040
+ },
+ {
+ "epoch": 7.562889165628892,
+ "eval_entropy": 0.2579477243991785,
+ "eval_loss": 0.8274564743041992,
+ "eval_mean_token_accuracy": 0.8517705212498821,
+ "eval_num_tokens": 7089390.0,
+ "eval_runtime": 85.8222,
+ "eval_samples_per_second": 16.022,
+ "eval_steps_per_second": 2.004,
+ "step": 3040
+ },
+ {
+ "entropy": 0.1296080862637609,
+ "epoch": 7.6127023661270234,
+ "grad_norm": 0.2371893972158432,
+ "learning_rate": 3.715745592968707e-05,
+ "loss": 0.06971035599708557,
+ "mean_token_accuracy": 0.9759043246507645,
+ "num_tokens": 7138002.0,
+ "step": 3060
+ },
+ {
+ "epoch": 7.6127023661270234,
+ "eval_entropy": 0.25391967083479083,
+ "eval_loss": 0.8197130560874939,
+ "eval_mean_token_accuracy": 0.8522267875283264,
+ "eval_num_tokens": 7138002.0,
+ "eval_runtime": 85.8796,
+ "eval_samples_per_second": 16.011,
+ "eval_steps_per_second": 2.003,
+ "step": 3060
+ },
+ {
+ "entropy": 0.1311203008517623,
+ "epoch": 7.662515566625156,
+ "grad_norm": 0.22499267756938934,
+ "learning_rate": 3.5713174634765967e-05,
+ "loss": 0.07176244258880615,
+ "mean_token_accuracy": 0.9754939571022987,
+ "num_tokens": 7185520.0,
+ "step": 3080
+ },
+ {
+ "epoch": 7.662515566625156,
+ "eval_entropy": 0.2526215241225653,
+ "eval_loss": 0.8265154361724854,
+ "eval_mean_token_accuracy": 0.8519952584837758,
+ "eval_num_tokens": 7185520.0,
+ "eval_runtime": 85.8746,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 3080
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 3.0323304467608166e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3100/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3100/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3100/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3100/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3100/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3100/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3100/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3100/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3100/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '\n' }}
+ {%- set args_value = args_value | tojson | safe if args_value is mapping or (args_value is sequence and args_value is not string) else args_value | string %}
+ {{- args_value }}
+ {{- '\n\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '\n' }}
+ {%- endfor %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+ {%- elif message.role == "tool" %}
+ {%- if loop.previtem and loop.previtem.role != "tool" %}
+ {{- '<|im_start|>user' }}
+ {%- endif %}
+ {{- '\n\n' }}
+ {{- content }}
+ {{- '\n' }}
+ {%- if not loop.last and loop.nextitem.role != "tool" %}
+ {{- '<|im_end|>\n' }}
+ {%- elif loop.last %}
+ {{- '<|im_end|>\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- raise_exception('Unexpected message role.') }}
+ {%- endif %}
+{%- endfor %}
+{%- if add_generation_prompt %}
+ {{- '<|im_start|>assistant\n' }}
+ {%- if enable_thinking is defined and enable_thinking is false %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n' }}
+ {%- endif %}
+{%- endif %}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3100/tokenizer_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3100/tokenizer_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..b4a37b2a6fd3ab3317cd7bac72855be1a843b2bb
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3100/tokenizer_config.json
@@ -0,0 +1,31 @@
+{
+ "add_prefix_space": false,
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "backend": "tokenizers",
+ "bos_token": null,
+ "clean_up_tokenization_spaces": false,
+ "eos_token": "<|endoftext|>",
+ "errors": "replace",
+ "image_token": "<|image_pad|>",
+ "is_local": false,
+ "model_max_length": 262144,
+ "model_specific_special_tokens": {
+ "audio_bos_token": "<|audio_start|>",
+ "audio_eos_token": "<|audio_end|>",
+ "audio_token": "<|audio_pad|>",
+ "image_token": "<|image_pad|>",
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+ },
+ "pad_token": "<|endoftext|>",
+ "pretokenize_regex": "(?i:'s|'t|'re|'ve|'m|'ll|'d)|[^\\r\\n\\p{L}\\p{N}]?[\\p{L}\\p{M}]+|\\p{N}| ?[^\\s\\p{L}\\p{M}\\p{N}]+[\\r\\n]*|\\s*[\\r\\n]+|\\s+(?!\\S)|\\s+",
+ "split_special_tokens": false,
+ "tokenizer_class": "TokenizersBackend",
+ "unk_token": null,
+ "video_token": "<|video_pad|>",
+ "vision_bos_token": "<|vision_start|>",
+ "vision_eos_token": "<|vision_end|>"
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3100/trainer_state.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3100/trainer_state.json
new file mode 100644
index 0000000000000000000000000000000000000000..a7b559582743775bf624c1375b296012a0292105
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3100/trainer_state.json
@@ -0,0 +1,3289 @@
+{
+ "best_global_step": null,
+ "best_metric": null,
+ "best_model_checkpoint": null,
+ "epoch": 7.712328767123288,
+ "eval_steps": 20,
+ "global_step": 3100,
+ "is_hyper_param_search": false,
+ "is_local_process_zero": true,
+ "is_world_process_zero": true,
+ "log_history": [
+ {
+ "entropy": 1.955029806494713,
+ "epoch": 0.049813200498132,
+ "grad_norm": 3.020533561706543,
+ "learning_rate": 1.0694800202775147e-05,
+ "loss": 1.7107986450195312,
+ "mean_token_accuracy": 0.6487608112394809,
+ "num_tokens": 46794.0,
+ "step": 20
+ },
+ {
+ "epoch": 0.049813200498132,
+ "eval_entropy": 1.3144892034835594,
+ "eval_loss": 1.1198534965515137,
+ "eval_mean_token_accuracy": 0.7460246955932572,
+ "eval_num_tokens": 46794.0,
+ "eval_runtime": 87.0565,
+ "eval_samples_per_second": 15.794,
+ "eval_steps_per_second": 1.976,
+ "step": 20
+ },
+ {
+ "entropy": 1.0063214391469955,
+ "epoch": 0.099626400996264,
+ "grad_norm": 1.572906494140625,
+ "learning_rate": 2.1952484626748985e-05,
+ "loss": 0.8663722991943359,
+ "mean_token_accuracy": 0.7779282338917255,
+ "num_tokens": 90754.0,
+ "step": 40
+ },
+ {
+ "epoch": 0.099626400996264,
+ "eval_entropy": 0.7921617945959402,
+ "eval_loss": 0.7062025666236877,
+ "eval_mean_token_accuracy": 0.8100443180910376,
+ "eval_num_tokens": 90754.0,
+ "eval_runtime": 86.5189,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 40
+ },
+ {
+ "entropy": 0.7682028576731682,
+ "epoch": 0.149439601494396,
+ "grad_norm": 1.3003711700439453,
+ "learning_rate": 3.3210169050722824e-05,
+ "loss": 0.673183822631836,
+ "mean_token_accuracy": 0.8182129614055157,
+ "num_tokens": 137472.0,
+ "step": 60
+ },
+ {
+ "epoch": 0.149439601494396,
+ "eval_entropy": 0.7059133584762729,
+ "eval_loss": 0.6481946706771851,
+ "eval_mean_token_accuracy": 0.8227418761613757,
+ "eval_num_tokens": 137472.0,
+ "eval_runtime": 86.5098,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 60
+ },
+ {
+ "entropy": 0.7029960259795189,
+ "epoch": 0.199252801992528,
+ "grad_norm": 1.3664201498031616,
+ "learning_rate": 4.4467853474696664e-05,
+ "loss": 0.6354611873626709,
+ "mean_token_accuracy": 0.8243416830897331,
+ "num_tokens": 187408.0,
+ "step": 80
+ },
+ {
+ "epoch": 0.199252801992528,
+ "eval_entropy": 0.6867308004997498,
+ "eval_loss": 0.6179807186126709,
+ "eval_mean_token_accuracy": 0.8302594811417335,
+ "eval_num_tokens": 187408.0,
+ "eval_runtime": 86.3969,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 80
+ },
+ {
+ "entropy": 0.6764581337571144,
+ "epoch": 0.24906600249066002,
+ "grad_norm": 0.9815880656242371,
+ "learning_rate": 5.57255378986705e-05,
+ "loss": 0.5988658905029297,
+ "mean_token_accuracy": 0.8329168625175953,
+ "num_tokens": 234197.0,
+ "step": 100
+ },
+ {
+ "epoch": 0.24906600249066002,
+ "eval_entropy": 0.6790881479202315,
+ "eval_loss": 0.5998476147651672,
+ "eval_mean_token_accuracy": 0.8318756420251935,
+ "eval_num_tokens": 234197.0,
+ "eval_runtime": 86.6653,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 100
+ },
+ {
+ "entropy": 0.6744543805718421,
+ "epoch": 0.298879202988792,
+ "grad_norm": 0.932099461555481,
+ "learning_rate": 6.698322232264434e-05,
+ "loss": 0.5991750717163086,
+ "mean_token_accuracy": 0.8304223112761975,
+ "num_tokens": 281241.0,
+ "step": 120
+ },
+ {
+ "epoch": 0.298879202988792,
+ "eval_entropy": 0.6813044282932614,
+ "eval_loss": 0.5922021269798279,
+ "eval_mean_token_accuracy": 0.8346439617317777,
+ "eval_num_tokens": 281241.0,
+ "eval_runtime": 86.1551,
+ "eval_samples_per_second": 15.96,
+ "eval_steps_per_second": 1.996,
+ "step": 120
+ },
+ {
+ "entropy": 0.6663189359009266,
+ "epoch": 0.34869240348692404,
+ "grad_norm": 0.9528499841690063,
+ "learning_rate": 7.824090674661818e-05,
+ "loss": 0.5891091346740722,
+ "mean_token_accuracy": 0.832152470946312,
+ "num_tokens": 327393.0,
+ "step": 140
+ },
+ {
+ "epoch": 0.34869240348692404,
+ "eval_entropy": 0.6398407208711602,
+ "eval_loss": 0.5859636664390564,
+ "eval_mean_token_accuracy": 0.8372074996316156,
+ "eval_num_tokens": 327393.0,
+ "eval_runtime": 86.2706,
+ "eval_samples_per_second": 15.938,
+ "eval_steps_per_second": 1.994,
+ "step": 140
+ },
+ {
+ "entropy": 0.64859763905406,
+ "epoch": 0.398505603985056,
+ "grad_norm": 0.8468204140663147,
+ "learning_rate": 8.949859117059201e-05,
+ "loss": 0.569426441192627,
+ "mean_token_accuracy": 0.8401990942656994,
+ "num_tokens": 373834.0,
+ "step": 160
+ },
+ {
+ "epoch": 0.398505603985056,
+ "eval_entropy": 0.6381674285891444,
+ "eval_loss": 0.5744525790214539,
+ "eval_mean_token_accuracy": 0.838626817908398,
+ "eval_num_tokens": 373834.0,
+ "eval_runtime": 86.2848,
+ "eval_samples_per_second": 15.936,
+ "eval_steps_per_second": 1.993,
+ "step": 160
+ },
+ {
+ "entropy": 0.6432608783245086,
+ "epoch": 0.44831880448318806,
+ "grad_norm": 0.8765804767608643,
+ "learning_rate": 0.00010075627559456587,
+ "loss": 0.5687318801879883,
+ "mean_token_accuracy": 0.839249350130558,
+ "num_tokens": 422572.0,
+ "step": 180
+ },
+ {
+ "epoch": 0.44831880448318806,
+ "eval_entropy": 0.6047098288355872,
+ "eval_loss": 0.5679298043251038,
+ "eval_mean_token_accuracy": 0.8410577181466791,
+ "eval_num_tokens": 422572.0,
+ "eval_runtime": 86.5879,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 180
+ },
+ {
+ "entropy": 0.6440276011824608,
+ "epoch": 0.49813200498132004,
+ "grad_norm": 0.9576020240783691,
+ "learning_rate": 0.00011201396001853971,
+ "loss": 0.5828506469726562,
+ "mean_token_accuracy": 0.837553184479475,
+ "num_tokens": 471879.0,
+ "step": 200
+ },
+ {
+ "epoch": 0.49813200498132004,
+ "eval_entropy": 0.6161119360909906,
+ "eval_loss": 0.5702911615371704,
+ "eval_mean_token_accuracy": 0.8407089398350827,
+ "eval_num_tokens": 471879.0,
+ "eval_runtime": 86.3341,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 200
+ },
+ {
+ "entropy": 0.6377195850014686,
+ "epoch": 0.547945205479452,
+ "grad_norm": 0.7212373614311218,
+ "learning_rate": 0.00012327164444251353,
+ "loss": 0.5702451229095459,
+ "mean_token_accuracy": 0.8397969007492065,
+ "num_tokens": 520984.0,
+ "step": 220
+ },
+ {
+ "epoch": 0.547945205479452,
+ "eval_entropy": 0.6080108886194784,
+ "eval_loss": 0.5633499622344971,
+ "eval_mean_token_accuracy": 0.8396634854549585,
+ "eval_num_tokens": 520984.0,
+ "eval_runtime": 86.4945,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 220
+ },
+ {
+ "entropy": 0.6287345830351114,
+ "epoch": 0.597758405977584,
+ "grad_norm": 0.848779022693634,
+ "learning_rate": 0.00013452932886648739,
+ "loss": 0.5506546020507812,
+ "mean_token_accuracy": 0.8438881888985634,
+ "num_tokens": 566596.0,
+ "step": 240
+ },
+ {
+ "epoch": 0.597758405977584,
+ "eval_entropy": 0.6307531505130058,
+ "eval_loss": 0.5573338270187378,
+ "eval_mean_token_accuracy": 0.8431362606758295,
+ "eval_num_tokens": 566596.0,
+ "eval_runtime": 86.3535,
+ "eval_samples_per_second": 15.923,
+ "eval_steps_per_second": 1.992,
+ "step": 240
+ },
+ {
+ "entropy": 0.6223786748945713,
+ "epoch": 0.6475716064757161,
+ "grad_norm": 0.7316951751708984,
+ "learning_rate": 0.0001457870132904612,
+ "loss": 0.5495625972747803,
+ "mean_token_accuracy": 0.8440376669168472,
+ "num_tokens": 613603.0,
+ "step": 260
+ },
+ {
+ "epoch": 0.6475716064757161,
+ "eval_entropy": 0.623454462476941,
+ "eval_loss": 0.5619264245033264,
+ "eval_mean_token_accuracy": 0.8431175777385401,
+ "eval_num_tokens": 613603.0,
+ "eval_runtime": 86.2008,
+ "eval_samples_per_second": 15.951,
+ "eval_steps_per_second": 1.995,
+ "step": 260
+ },
+ {
+ "entropy": 0.6281675305217505,
+ "epoch": 0.6973848069738481,
+ "grad_norm": 0.7639564871788025,
+ "learning_rate": 0.00015704469771443506,
+ "loss": 0.5604369163513183,
+ "mean_token_accuracy": 0.8401600055396556,
+ "num_tokens": 658565.0,
+ "step": 280
+ },
+ {
+ "epoch": 0.6973848069738481,
+ "eval_entropy": 0.63416675980701,
+ "eval_loss": 0.5612760782241821,
+ "eval_mean_token_accuracy": 0.842435666294985,
+ "eval_num_tokens": 658565.0,
+ "eval_runtime": 86.25,
+ "eval_samples_per_second": 15.942,
+ "eval_steps_per_second": 1.994,
+ "step": 280
+ },
+ {
+ "entropy": 0.6427909277379513,
+ "epoch": 0.7471980074719801,
+ "grad_norm": 0.6475813388824463,
+ "learning_rate": 0.0001683023821384089,
+ "loss": 0.573763370513916,
+ "mean_token_accuracy": 0.8370340794324875,
+ "num_tokens": 705680.0,
+ "step": 300
+ },
+ {
+ "epoch": 0.7471980074719801,
+ "eval_entropy": 0.6231539840268534,
+ "eval_loss": 0.5566866397857666,
+ "eval_mean_token_accuracy": 0.844177934319474,
+ "eval_num_tokens": 705680.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 300
+ },
+ {
+ "entropy": 0.6226776849478484,
+ "epoch": 0.797011207970112,
+ "grad_norm": 0.8886699676513672,
+ "learning_rate": 0.00017956006656238274,
+ "loss": 0.558210802078247,
+ "mean_token_accuracy": 0.84083157107234,
+ "num_tokens": 752616.0,
+ "step": 320
+ },
+ {
+ "epoch": 0.797011207970112,
+ "eval_entropy": 0.6066981683983359,
+ "eval_loss": 0.5585207939147949,
+ "eval_mean_token_accuracy": 0.8423153311014175,
+ "eval_num_tokens": 752616.0,
+ "eval_runtime": 86.3463,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 320
+ },
+ {
+ "entropy": 0.6249004438519478,
+ "epoch": 0.8468244084682441,
+ "grad_norm": 0.8791211843490601,
+ "learning_rate": 0.00019081775098635657,
+ "loss": 0.5603597164154053,
+ "mean_token_accuracy": 0.8420463085174561,
+ "num_tokens": 797151.0,
+ "step": 340
+ },
+ {
+ "epoch": 0.8468244084682441,
+ "eval_entropy": 0.6082247584018596,
+ "eval_loss": 0.5616299510002136,
+ "eval_mean_token_accuracy": 0.8431286801432454,
+ "eval_num_tokens": 797151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 340
+ },
+ {
+ "entropy": 0.6362396612763405,
+ "epoch": 0.8966376089663761,
+ "grad_norm": 0.8606319427490234,
+ "learning_rate": 0.0002020754354103304,
+ "loss": 0.5735773563385009,
+ "mean_token_accuracy": 0.8371490836143494,
+ "num_tokens": 843585.0,
+ "step": 360
+ },
+ {
+ "epoch": 0.8966376089663761,
+ "eval_entropy": 0.6492362072648004,
+ "eval_loss": 0.5646467804908752,
+ "eval_mean_token_accuracy": 0.8415517574825953,
+ "eval_num_tokens": 843585.0,
+ "eval_runtime": 86.3351,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 360
+ },
+ {
+ "entropy": 0.638665035739541,
+ "epoch": 0.9464508094645081,
+ "grad_norm": 0.7773950099945068,
+ "learning_rate": 0.00021333311983430425,
+ "loss": 0.5820859909057617,
+ "mean_token_accuracy": 0.8372561208903789,
+ "num_tokens": 889842.0,
+ "step": 380
+ },
+ {
+ "epoch": 0.9464508094645081,
+ "eval_entropy": 0.6434498637221581,
+ "eval_loss": 0.5645168423652649,
+ "eval_mean_token_accuracy": 0.8420382481674815,
+ "eval_num_tokens": 889842.0,
+ "eval_runtime": 86.1216,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 380
+ },
+ {
+ "entropy": 0.6316851265728474,
+ "epoch": 0.9962640099626401,
+ "grad_norm": 1.6120579242706299,
+ "learning_rate": 0.00022459080425827807,
+ "loss": 0.5637502670288086,
+ "mean_token_accuracy": 0.8386227294802666,
+ "num_tokens": 935589.0,
+ "step": 400
+ },
+ {
+ "epoch": 0.9962640099626401,
+ "eval_entropy": 0.6469012776086497,
+ "eval_loss": 0.5758090615272522,
+ "eval_mean_token_accuracy": 0.8397158470957778,
+ "eval_num_tokens": 935589.0,
+ "eval_runtime": 86.6139,
+ "eval_samples_per_second": 15.875,
+ "eval_steps_per_second": 1.986,
+ "step": 400
+ },
+ {
+ "entropy": 0.5894816922835815,
+ "epoch": 1.0448318804483188,
+ "grad_norm": 1.1616325378417969,
+ "learning_rate": 0.00022626713048053178,
+ "loss": 0.5316025257110596,
+ "mean_token_accuracy": 0.8466163017810919,
+ "num_tokens": 980589.0,
+ "step": 420
+ },
+ {
+ "epoch": 1.0448318804483188,
+ "eval_entropy": 0.5860798164855602,
+ "eval_loss": 0.5777581930160522,
+ "eval_mean_token_accuracy": 0.8396938103576039,
+ "eval_num_tokens": 980589.0,
+ "eval_runtime": 86.1449,
+ "eval_samples_per_second": 15.961,
+ "eval_steps_per_second": 1.997,
+ "step": 420
+ },
+ {
+ "entropy": 0.5818420693278312,
+ "epoch": 1.0946450809464507,
+ "grad_norm": 0.7999453544616699,
+ "learning_rate": 0.00022622107023288778,
+ "loss": 0.5221010208129883,
+ "mean_token_accuracy": 0.8474301159381866,
+ "num_tokens": 1027852.0,
+ "step": 440
+ },
+ {
+ "epoch": 1.0946450809464507,
+ "eval_entropy": 0.5783926014636838,
+ "eval_loss": 0.5700300931930542,
+ "eval_mean_token_accuracy": 0.8430753537388735,
+ "eval_num_tokens": 1027852.0,
+ "eval_runtime": 86.5308,
+ "eval_samples_per_second": 15.89,
+ "eval_steps_per_second": 1.988,
+ "step": 440
+ },
+ {
+ "entropy": 0.5612493887543678,
+ "epoch": 1.1444582814445827,
+ "grad_norm": 1.015687346458435,
+ "learning_rate": 0.00022614090619491568,
+ "loss": 0.5084867000579834,
+ "mean_token_accuracy": 0.8495561093091964,
+ "num_tokens": 1077649.0,
+ "step": 460
+ },
+ {
+ "epoch": 1.1444582814445827,
+ "eval_entropy": 0.5841563874205877,
+ "eval_loss": 0.5693665742874146,
+ "eval_mean_token_accuracy": 0.8427817298229351,
+ "eval_num_tokens": 1077649.0,
+ "eval_runtime": 86.5256,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 460
+ },
+ {
+ "entropy": 0.5828216474503278,
+ "epoch": 1.1942714819427147,
+ "grad_norm": 1.9750930070877075,
+ "learning_rate": 0.00022602666254299594,
+ "loss": 0.5180017948150635,
+ "mean_token_accuracy": 0.8515685826539994,
+ "num_tokens": 1124872.0,
+ "step": 480
+ },
+ {
+ "epoch": 1.1942714819427147,
+ "eval_entropy": 0.5806607044366903,
+ "eval_loss": 0.5804352760314941,
+ "eval_mean_token_accuracy": 0.8413014668364858,
+ "eval_num_tokens": 1124872.0,
+ "eval_runtime": 86.1199,
+ "eval_samples_per_second": 15.966,
+ "eval_steps_per_second": 1.997,
+ "step": 480
+ },
+ {
+ "entropy": 0.5926914308220148,
+ "epoch": 1.244084682440847,
+ "grad_norm": 0.8917353749275208,
+ "learning_rate": 0.0002258783737314558,
+ "loss": 0.528910779953003,
+ "mean_token_accuracy": 0.8486074328422546,
+ "num_tokens": 1168698.0,
+ "step": 500
+ },
+ {
+ "epoch": 1.244084682440847,
+ "eval_entropy": 0.5593361884009006,
+ "eval_loss": 0.5675153732299805,
+ "eval_mean_token_accuracy": 0.8433507802181466,
+ "eval_num_tokens": 1168698.0,
+ "eval_runtime": 86.7289,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 500
+ },
+ {
+ "entropy": 0.5865630559623242,
+ "epoch": 1.293897882938979,
+ "grad_norm": 0.7482362985610962,
+ "learning_rate": 0.00022569608448217823,
+ "loss": 0.5250466823577881,
+ "mean_token_accuracy": 0.8477916084229946,
+ "num_tokens": 1216679.0,
+ "step": 520
+ },
+ {
+ "epoch": 1.293897882938979,
+ "eval_entropy": 0.543057840230853,
+ "eval_loss": 0.5671008229255676,
+ "eval_mean_token_accuracy": 0.8428726016088973,
+ "eval_num_tokens": 1216679.0,
+ "eval_runtime": 86.3403,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 520
+ },
+ {
+ "entropy": 0.5870206747204065,
+ "epoch": 1.3437110834371109,
+ "grad_norm": 0.9473814964294434,
+ "learning_rate": 0.00022547984977111448,
+ "loss": 0.5252370834350586,
+ "mean_token_accuracy": 0.8468369916081429,
+ "num_tokens": 1261365.0,
+ "step": 540
+ },
+ {
+ "epoch": 1.3437110834371109,
+ "eval_entropy": 0.590982622878496,
+ "eval_loss": 0.5676343441009521,
+ "eval_mean_token_accuracy": 0.8429348746011424,
+ "eval_num_tokens": 1261365.0,
+ "eval_runtime": 86.5168,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 540
+ },
+ {
+ "entropy": 0.5785854265093804,
+ "epoch": 1.3935242839352429,
+ "grad_norm": 0.9353351593017578,
+ "learning_rate": 0.0002252297348117042,
+ "loss": 0.5304938316345215,
+ "mean_token_accuracy": 0.8463383808732032,
+ "num_tokens": 1306879.0,
+ "step": 560
+ },
+ {
+ "epoch": 1.3935242839352429,
+ "eval_entropy": 0.6099918867612995,
+ "eval_loss": 0.5620437860488892,
+ "eval_mean_token_accuracy": 0.8430728347495545,
+ "eval_num_tokens": 1306879.0,
+ "eval_runtime": 86.7741,
+ "eval_samples_per_second": 15.846,
+ "eval_steps_per_second": 1.982,
+ "step": 560
+ },
+ {
+ "entropy": 0.5768801040947438,
+ "epoch": 1.4433374844333748,
+ "grad_norm": 0.9198738932609558,
+ "learning_rate": 0.0002249458150352077,
+ "loss": 0.520513391494751,
+ "mean_token_accuracy": 0.8487689301371575,
+ "num_tokens": 1353534.0,
+ "step": 580
+ },
+ {
+ "epoch": 1.4433374844333748,
+ "eval_entropy": 0.6349420670506566,
+ "eval_loss": 0.5645340085029602,
+ "eval_mean_token_accuracy": 0.8447844597489335,
+ "eval_num_tokens": 1353534.0,
+ "eval_runtime": 86.3257,
+ "eval_samples_per_second": 15.928,
+ "eval_steps_per_second": 1.992,
+ "step": 580
+ },
+ {
+ "entropy": 0.5822233572602272,
+ "epoch": 1.4931506849315068,
+ "grad_norm": 0.832811176776886,
+ "learning_rate": 0.0002246281760679571,
+ "loss": 0.5295282363891601,
+ "mean_token_accuracy": 0.8504064798355102,
+ "num_tokens": 1399537.0,
+ "step": 600
+ },
+ {
+ "epoch": 1.4931506849315068,
+ "eval_entropy": 0.5829724387027496,
+ "eval_loss": 0.5612193942070007,
+ "eval_mean_token_accuracy": 0.8449643853791925,
+ "eval_num_tokens": 1399537.0,
+ "eval_runtime": 86.6617,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 600
+ },
+ {
+ "entropy": 0.571855777129531,
+ "epoch": 1.5429638854296388,
+ "grad_norm": 0.7665547728538513,
+ "learning_rate": 0.00022427691370553263,
+ "loss": 0.5187931060791016,
+ "mean_token_accuracy": 0.8534420043230057,
+ "num_tokens": 1448422.0,
+ "step": 620
+ },
+ {
+ "epoch": 1.5429638854296388,
+ "eval_entropy": 0.5623592240519302,
+ "eval_loss": 0.5575760006904602,
+ "eval_mean_token_accuracy": 0.8468210229346919,
+ "eval_num_tokens": 1448422.0,
+ "eval_runtime": 86.6324,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 620
+ },
+ {
+ "entropy": 0.5740394659340382,
+ "epoch": 1.592777085927771,
+ "grad_norm": 0.6500429511070251,
+ "learning_rate": 0.00022389213388387174,
+ "loss": 0.5283198833465577,
+ "mean_token_accuracy": 0.8502798482775689,
+ "num_tokens": 1495009.0,
+ "step": 640
+ },
+ {
+ "epoch": 1.592777085927771,
+ "eval_entropy": 0.5548852207355721,
+ "eval_loss": 0.5561797022819519,
+ "eval_mean_token_accuracy": 0.8452786498291548,
+ "eval_num_tokens": 1495009.0,
+ "eval_runtime": 86.5205,
+ "eval_samples_per_second": 15.892,
+ "eval_steps_per_second": 1.988,
+ "step": 640
+ },
+ {
+ "entropy": 0.6020145989954472,
+ "epoch": 1.6425902864259028,
+ "grad_norm": 0.7056867480278015,
+ "learning_rate": 0.00022347395264732053,
+ "loss": 0.5400049209594726,
+ "mean_token_accuracy": 0.8447613954544068,
+ "num_tokens": 1536932.0,
+ "step": 660
+ },
+ {
+ "epoch": 1.6425902864259028,
+ "eval_entropy": 0.5618055154417836,
+ "eval_loss": 0.556106686592102,
+ "eval_mean_token_accuracy": 0.8465680112672407,
+ "eval_num_tokens": 1536932.0,
+ "eval_runtime": 86.2971,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 660
+ },
+ {
+ "entropy": 0.5665927153080702,
+ "epoch": 1.692403486924035,
+ "grad_norm": 0.5987663865089417,
+ "learning_rate": 0.00022302249611363625,
+ "loss": 0.5143643856048584,
+ "mean_token_accuracy": 0.8529589556157589,
+ "num_tokens": 1585718.0,
+ "step": 680
+ },
+ {
+ "epoch": 1.692403486924035,
+ "eval_entropy": 0.568248552118623,
+ "eval_loss": 0.5476346015930176,
+ "eval_mean_token_accuracy": 0.8476775434128073,
+ "eval_num_tokens": 1585718.0,
+ "eval_runtime": 86.9583,
+ "eval_samples_per_second": 15.812,
+ "eval_steps_per_second": 1.978,
+ "step": 680
+ },
+ {
+ "entropy": 0.5673687808215618,
+ "epoch": 1.7422166874221667,
+ "grad_norm": 0.735261857509613,
+ "learning_rate": 0.00022253790043595193,
+ "loss": 0.509885597229004,
+ "mean_token_accuracy": 0.8537046857178211,
+ "num_tokens": 1635718.0,
+ "step": 700
+ },
+ {
+ "epoch": 1.7422166874221667,
+ "eval_entropy": 0.5616967284748721,
+ "eval_loss": 0.5439274311065674,
+ "eval_mean_token_accuracy": 0.8488946217437123,
+ "eval_num_tokens": 1635718.0,
+ "eval_runtime": 86.0604,
+ "eval_samples_per_second": 15.977,
+ "eval_steps_per_second": 1.999,
+ "step": 700
+ },
+ {
+ "entropy": 0.5529541682451964,
+ "epoch": 1.792029887920299,
+ "grad_norm": 0.7014835476875305,
+ "learning_rate": 0.00022202031176171442,
+ "loss": 0.5078992366790771,
+ "mean_token_accuracy": 0.8525233261287213,
+ "num_tokens": 1681291.0,
+ "step": 720
+ },
+ {
+ "epoch": 1.792029887920299,
+ "eval_entropy": 0.5827173320359962,
+ "eval_loss": 0.5419450402259827,
+ "eval_mean_token_accuracy": 0.8477318609176681,
+ "eval_num_tokens": 1681291.0,
+ "eval_runtime": 85.2984,
+ "eval_samples_per_second": 16.12,
+ "eval_steps_per_second": 2.016,
+ "step": 720
+ },
+ {
+ "entropy": 0.5755720350891351,
+ "epoch": 1.841843088418431,
+ "grad_norm": 0.705613911151886,
+ "learning_rate": 0.00022146988618860824,
+ "loss": 0.5181350708007812,
+ "mean_token_accuracy": 0.8467609457671642,
+ "num_tokens": 1729102.0,
+ "step": 740
+ },
+ {
+ "epoch": 1.841843088418431,
+ "eval_entropy": 0.5743971356125765,
+ "eval_loss": 0.5415896773338318,
+ "eval_mean_token_accuracy": 0.847328585940738,
+ "eval_num_tokens": 1729102.0,
+ "eval_runtime": 85.5602,
+ "eval_samples_per_second": 16.071,
+ "eval_steps_per_second": 2.01,
+ "step": 740
+ },
+ {
+ "entropy": 0.561330484598875,
+ "epoch": 1.891656288916563,
+ "grad_norm": 0.6722865700721741,
+ "learning_rate": 0.0002208867897174789,
+ "loss": 0.499837589263916,
+ "mean_token_accuracy": 0.8518734864890576,
+ "num_tokens": 1773578.0,
+ "step": 760
+ },
+ {
+ "epoch": 1.891656288916563,
+ "eval_entropy": 0.5865232653396074,
+ "eval_loss": 0.5437926650047302,
+ "eval_mean_token_accuracy": 0.8450997017843779,
+ "eval_num_tokens": 1773578.0,
+ "eval_runtime": 86.4116,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 760
+ },
+ {
+ "entropy": 0.547389242425561,
+ "epoch": 1.9414694894146949,
+ "grad_norm": 0.7935577034950256,
+ "learning_rate": 0.00022027119820226907,
+ "loss": 0.4977591514587402,
+ "mean_token_accuracy": 0.8539491161704064,
+ "num_tokens": 1821725.0,
+ "step": 780
+ },
+ {
+ "epoch": 1.9414694894146949,
+ "eval_entropy": 0.5290903090391048,
+ "eval_loss": 0.5409526824951172,
+ "eval_mean_token_accuracy": 0.8497545698354411,
+ "eval_num_tokens": 1821725.0,
+ "eval_runtime": 86.7262,
+ "eval_samples_per_second": 15.854,
+ "eval_steps_per_second": 1.983,
+ "step": 780
+ },
+ {
+ "entropy": 0.5687909748405218,
+ "epoch": 1.9912826899128269,
+ "grad_norm": 0.6180546283721924,
+ "learning_rate": 0.00021962329729698345,
+ "loss": 0.5109643459320068,
+ "mean_token_accuracy": 0.8521598495543004,
+ "num_tokens": 1868431.0,
+ "step": 800
+ },
+ {
+ "epoch": 1.9912826899128269,
+ "eval_entropy": 0.5503541858390321,
+ "eval_loss": 0.5361555218696594,
+ "eval_mean_token_accuracy": 0.8510884285666221,
+ "eval_num_tokens": 1868431.0,
+ "eval_runtime": 86.3339,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 800
+ },
+ {
+ "entropy": 0.4739728841261986,
+ "epoch": 2.0398505603985058,
+ "grad_norm": 0.8058829307556152,
+ "learning_rate": 0.0002189432823996982,
+ "loss": 0.4204097747802734,
+ "mean_token_accuracy": 0.8728981889211215,
+ "num_tokens": 1915280.0,
+ "step": 820
+ },
+ {
+ "epoch": 2.0398505603985058,
+ "eval_entropy": 0.5077334992414297,
+ "eval_loss": 0.5531114339828491,
+ "eval_mean_token_accuracy": 0.8489257208136625,
+ "eval_num_tokens": 1915280.0,
+ "eval_runtime": 86.4801,
+ "eval_samples_per_second": 15.9,
+ "eval_steps_per_second": 1.989,
+ "step": 820
+ },
+ {
+ "entropy": 0.4594309840351343,
+ "epoch": 2.0896637608966375,
+ "grad_norm": 0.6906896829605103,
+ "learning_rate": 0.0002182313585936314,
+ "loss": 0.4071959495544434,
+ "mean_token_accuracy": 0.8732857562601566,
+ "num_tokens": 1965306.0,
+ "step": 840
+ },
+ {
+ "epoch": 2.0896637608966375,
+ "eval_entropy": 0.49850136994622474,
+ "eval_loss": 0.5486204624176025,
+ "eval_mean_token_accuracy": 0.8507991450470548,
+ "eval_num_tokens": 1965306.0,
+ "eval_runtime": 86.3364,
+ "eval_samples_per_second": 15.926,
+ "eval_steps_per_second": 1.992,
+ "step": 840
+ },
+ {
+ "entropy": 0.4881629109382629,
+ "epoch": 2.1394769613947697,
+ "grad_norm": 0.6343470215797424,
+ "learning_rate": 0.0002174877405852928,
+ "loss": 0.41669540405273436,
+ "mean_token_accuracy": 0.8711295068264008,
+ "num_tokens": 2008562.0,
+ "step": 860
+ },
+ {
+ "epoch": 2.1394769613947697,
+ "eval_entropy": 0.49155513924914734,
+ "eval_loss": 0.555109441280365,
+ "eval_mean_token_accuracy": 0.8496399400539176,
+ "eval_num_tokens": 2008562.0,
+ "eval_runtime": 86.3295,
+ "eval_samples_per_second": 15.927,
+ "eval_steps_per_second": 1.992,
+ "step": 860
+ },
+ {
+ "entropy": 0.4648668970912695,
+ "epoch": 2.1892901618929015,
+ "grad_norm": 0.8014165163040161,
+ "learning_rate": 0.00021671265263973133,
+ "loss": 0.4110250473022461,
+ "mean_token_accuracy": 0.8754166305065155,
+ "num_tokens": 2056474.0,
+ "step": 880
+ },
+ {
+ "epoch": 2.1892901618929015,
+ "eval_entropy": 0.4909258722219356,
+ "eval_loss": 0.5539511442184448,
+ "eval_mean_token_accuracy": 0.8492401502160138,
+ "eval_num_tokens": 2056474.0,
+ "eval_runtime": 86.3468,
+ "eval_samples_per_second": 15.924,
+ "eval_steps_per_second": 1.992,
+ "step": 880
+ },
+ {
+ "entropy": 0.4824485514312983,
+ "epoch": 2.2391033623910337,
+ "grad_norm": 0.6665191054344177,
+ "learning_rate": 0.00021590632851289967,
+ "loss": 0.4181404113769531,
+ "mean_token_accuracy": 0.8726993151009083,
+ "num_tokens": 2103543.0,
+ "step": 900
+ },
+ {
+ "epoch": 2.2391033623910337,
+ "eval_entropy": 0.4986876940657926,
+ "eval_loss": 0.547695517539978,
+ "eval_mean_token_accuracy": 0.8501384708770486,
+ "eval_num_tokens": 2103543.0,
+ "eval_runtime": 86.3838,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 900
+ },
+ {
+ "entropy": 0.4751896943897009,
+ "epoch": 2.2889165628891655,
+ "grad_norm": 0.81158047914505,
+ "learning_rate": 0.00021506901138115678,
+ "loss": 0.40689678192138673,
+ "mean_token_accuracy": 0.8745221219956875,
+ "num_tokens": 2147861.0,
+ "step": 920
+ },
+ {
+ "epoch": 2.2889165628891655,
+ "eval_entropy": 0.507153491121392,
+ "eval_loss": 0.5501641631126404,
+ "eval_mean_token_accuracy": 0.8495670116918032,
+ "eval_num_tokens": 2147861.0,
+ "eval_runtime": 86.0912,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 920
+ },
+ {
+ "entropy": 0.4873133715242147,
+ "epoch": 2.3387297633872977,
+ "grad_norm": 0.7218056321144104,
+ "learning_rate": 0.0002142009537679292,
+ "loss": 0.42701358795166017,
+ "mean_token_accuracy": 0.8695114746689796,
+ "num_tokens": 2190561.0,
+ "step": 940
+ },
+ {
+ "epoch": 2.3387297633872977,
+ "eval_entropy": 0.5202612736543943,
+ "eval_loss": 0.5491839051246643,
+ "eval_mean_token_accuracy": 0.8494071208460386,
+ "eval_num_tokens": 2190561.0,
+ "eval_runtime": 86.1142,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 940
+ },
+ {
+ "entropy": 0.4762951169162989,
+ "epoch": 2.3885429638854294,
+ "grad_norm": 0.7194424867630005,
+ "learning_rate": 0.0002133024174675534,
+ "loss": 0.42299847602844237,
+ "mean_token_accuracy": 0.8709790132939815,
+ "num_tokens": 2239412.0,
+ "step": 960
+ },
+ {
+ "epoch": 2.3885429638854294,
+ "eval_entropy": 0.4899340462546016,
+ "eval_loss": 0.5522511601448059,
+ "eval_mean_token_accuracy": 0.8492208258357159,
+ "eval_num_tokens": 2239412.0,
+ "eval_runtime": 86.463,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 960
+ },
+ {
+ "entropy": 0.49650347977876663,
+ "epoch": 2.4383561643835616,
+ "grad_norm": 0.8406022787094116,
+ "learning_rate": 0.0002123736734663221,
+ "loss": 0.4275330066680908,
+ "mean_token_accuracy": 0.8670595556497573,
+ "num_tokens": 2286283.0,
+ "step": 980
+ },
+ {
+ "epoch": 2.4383561643835616,
+ "eval_entropy": 0.49691385654515996,
+ "eval_loss": 0.5491269826889038,
+ "eval_mean_token_accuracy": 0.850309816210769,
+ "eval_num_tokens": 2286283.0,
+ "eval_runtime": 86.17,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 980
+ },
+ {
+ "entropy": 0.48843890577554705,
+ "epoch": 2.488169364881694,
+ "grad_norm": 0.9082473516464233,
+ "learning_rate": 0.00021141500186075868,
+ "loss": 0.4309722423553467,
+ "mean_token_accuracy": 0.8686766296625137,
+ "num_tokens": 2333733.0,
+ "step": 1000
+ },
+ {
+ "epoch": 2.488169364881694,
+ "eval_entropy": 0.5543508351195691,
+ "eval_loss": 0.5478800535202026,
+ "eval_mean_token_accuracy": 0.8478029522784921,
+ "eval_num_tokens": 2333733.0,
+ "eval_runtime": 86.3835,
+ "eval_samples_per_second": 15.917,
+ "eval_steps_per_second": 1.991,
+ "step": 1000
+ },
+ {
+ "entropy": 0.4777219031006098,
+ "epoch": 2.5379825653798256,
+ "grad_norm": 0.7448089122772217,
+ "learning_rate": 0.0002104266917731438,
+ "loss": 0.423325252532959,
+ "mean_token_accuracy": 0.8706337086856365,
+ "num_tokens": 2384270.0,
+ "step": 1020
+ },
+ {
+ "epoch": 2.5379825653798256,
+ "eval_entropy": 0.49857561550168106,
+ "eval_loss": 0.5511948466300964,
+ "eval_mean_token_accuracy": 0.8502220289651737,
+ "eval_num_tokens": 2384270.0,
+ "eval_runtime": 86.5399,
+ "eval_samples_per_second": 15.889,
+ "eval_steps_per_second": 1.988,
+ "step": 1020
+ },
+ {
+ "entropy": 0.4844174191355705,
+ "epoch": 2.587795765877958,
+ "grad_norm": 0.794029176235199,
+ "learning_rate": 0.00020940904126432,
+ "loss": 0.4176753044128418,
+ "mean_token_accuracy": 0.873535567522049,
+ "num_tokens": 2428036.0,
+ "step": 1040
+ },
+ {
+ "epoch": 2.587795765877958,
+ "eval_entropy": 0.485467542222766,
+ "eval_loss": 0.5539286732673645,
+ "eval_mean_token_accuracy": 0.8495475081510322,
+ "eval_num_tokens": 2428036.0,
+ "eval_runtime": 86.135,
+ "eval_samples_per_second": 15.963,
+ "eval_steps_per_second": 1.997,
+ "step": 1040
+ },
+ {
+ "entropy": 0.49070929251611234,
+ "epoch": 2.6376089663760895,
+ "grad_norm": 0.7558256983757019,
+ "learning_rate": 0.0002083623572438007,
+ "loss": 0.42867293357849123,
+ "mean_token_accuracy": 0.8696666076779366,
+ "num_tokens": 2476815.0,
+ "step": 1060
+ },
+ {
+ "epoch": 2.6376089663760895,
+ "eval_entropy": 0.490822730889154,
+ "eval_loss": 0.5434785485267639,
+ "eval_mean_token_accuracy": 0.850568296950917,
+ "eval_num_tokens": 2476815.0,
+ "eval_runtime": 86.4933,
+ "eval_samples_per_second": 15.897,
+ "eval_steps_per_second": 1.989,
+ "step": 1060
+ },
+ {
+ "entropy": 0.47806114703416824,
+ "epoch": 2.6874221668742218,
+ "grad_norm": 0.6608979105949402,
+ "learning_rate": 0.00020728695537721047,
+ "loss": 0.4289727687835693,
+ "mean_token_accuracy": 0.8693130135536193,
+ "num_tokens": 2527131.0,
+ "step": 1080
+ },
+ {
+ "epoch": 2.6874221668742218,
+ "eval_entropy": 0.5285773256490397,
+ "eval_loss": 0.5444230437278748,
+ "eval_mean_token_accuracy": 0.8498796481032704,
+ "eval_num_tokens": 2527131.0,
+ "eval_runtime": 86.7091,
+ "eval_samples_per_second": 15.858,
+ "eval_steps_per_second": 1.984,
+ "step": 1080
+ },
+ {
+ "entropy": 0.5046216730028391,
+ "epoch": 2.7372353673723535,
+ "grad_norm": 0.8428544998168945,
+ "learning_rate": 0.00020618315999108454,
+ "loss": 0.43131070137023925,
+ "mean_token_accuracy": 0.8701941035687923,
+ "num_tokens": 2572537.0,
+ "step": 1100
+ },
+ {
+ "epoch": 2.7372353673723535,
+ "eval_entropy": 0.49888394738352576,
+ "eval_loss": 0.5459766387939453,
+ "eval_mean_token_accuracy": 0.8511758872935938,
+ "eval_num_tokens": 2572537.0,
+ "eval_runtime": 86.2222,
+ "eval_samples_per_second": 15.947,
+ "eval_steps_per_second": 1.995,
+ "step": 1100
+ },
+ {
+ "entropy": 0.5212558470666409,
+ "epoch": 2.7870485678704857,
+ "grad_norm": 1.129318118095398,
+ "learning_rate": 0.00020505130397505635,
+ "loss": 0.44249300956726073,
+ "mean_token_accuracy": 0.8654101334512234,
+ "num_tokens": 2616047.0,
+ "step": 1120
+ },
+ {
+ "epoch": 2.7870485678704857,
+ "eval_entropy": 0.5179622324053631,
+ "eval_loss": 0.5522801280021667,
+ "eval_mean_token_accuracy": 0.8497019947268242,
+ "eval_num_tokens": 2616047.0,
+ "eval_runtime": 86.1903,
+ "eval_samples_per_second": 15.953,
+ "eval_steps_per_second": 1.996,
+ "step": 1120
+ },
+ {
+ "entropy": 0.4988406613469124,
+ "epoch": 2.8368617683686175,
+ "grad_norm": 0.6460545063018799,
+ "learning_rate": 0.00020389172868146263,
+ "loss": 0.4386270523071289,
+ "mean_token_accuracy": 0.8690383620560169,
+ "num_tokens": 2664744.0,
+ "step": 1140
+ },
+ {
+ "epoch": 2.8368617683686175,
+ "eval_entropy": 0.5042278484203094,
+ "eval_loss": 0.5433034300804138,
+ "eval_mean_token_accuracy": 0.8497674451317898,
+ "eval_num_tokens": 2664744.0,
+ "eval_runtime": 86.3028,
+ "eval_samples_per_second": 15.932,
+ "eval_steps_per_second": 1.993,
+ "step": 1140
+ },
+ {
+ "entropy": 0.4926559619605541,
+ "epoch": 2.8866749688667497,
+ "grad_norm": 0.8199329972267151,
+ "learning_rate": 0.00020270478382239615,
+ "loss": 0.4313485145568848,
+ "mean_token_accuracy": 0.8674727231264114,
+ "num_tokens": 2710196.0,
+ "step": 1160
+ },
+ {
+ "epoch": 2.8866749688667497,
+ "eval_entropy": 0.503873193160046,
+ "eval_loss": 0.5388111472129822,
+ "eval_mean_token_accuracy": 0.8526195034731266,
+ "eval_num_tokens": 2710196.0,
+ "eval_runtime": 86.4054,
+ "eval_samples_per_second": 15.913,
+ "eval_steps_per_second": 1.991,
+ "step": 1160
+ },
+ {
+ "entropy": 0.5020013231784105,
+ "epoch": 2.936488169364882,
+ "grad_norm": 0.7344821095466614,
+ "learning_rate": 0.00020149082736423723,
+ "loss": 0.43590536117553713,
+ "mean_token_accuracy": 0.8671772189438343,
+ "num_tokens": 2758752.0,
+ "step": 1180
+ },
+ {
+ "epoch": 2.936488169364882,
+ "eval_entropy": 0.5368241809828337,
+ "eval_loss": 0.5355703830718994,
+ "eval_mean_token_accuracy": 0.8517617773871089,
+ "eval_num_tokens": 2758752.0,
+ "eval_runtime": 86.2945,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1180
+ },
+ {
+ "entropy": 0.5112275708466768,
+ "epoch": 2.9863013698630136,
+ "grad_norm": 0.6951606869697571,
+ "learning_rate": 0.00020025022541969622,
+ "loss": 0.43579301834106443,
+ "mean_token_accuracy": 0.8641206480562686,
+ "num_tokens": 2803186.0,
+ "step": 1200
+ },
+ {
+ "epoch": 2.9863013698630136,
+ "eval_entropy": 0.5066795706055885,
+ "eval_loss": 0.5415249466896057,
+ "eval_mean_token_accuracy": 0.8493563373421513,
+ "eval_num_tokens": 2803186.0,
+ "eval_runtime": 86.5005,
+ "eval_samples_per_second": 15.896,
+ "eval_steps_per_second": 1.988,
+ "step": 1200
+ },
+ {
+ "entropy": 0.42298635305502474,
+ "epoch": 3.0348692403486925,
+ "grad_norm": 0.8201794028282166,
+ "learning_rate": 0.00019898335213739863,
+ "loss": 0.35593905448913576,
+ "mean_token_accuracy": 0.889238600547497,
+ "num_tokens": 2848509.0,
+ "step": 1220
+ },
+ {
+ "epoch": 3.0348692403486925,
+ "eval_entropy": 0.4584170470750609,
+ "eval_loss": 0.569487452507019,
+ "eval_mean_token_accuracy": 0.8495814173027526,
+ "eval_num_tokens": 2848509.0,
+ "eval_runtime": 86.2281,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 1220
+ },
+ {
+ "entropy": 0.37450140453875064,
+ "epoch": 3.0846824408468243,
+ "grad_norm": 0.7308394908905029,
+ "learning_rate": 0.0001976905895890471,
+ "loss": 0.307823920249939,
+ "mean_token_accuracy": 0.9001288741827012,
+ "num_tokens": 2894976.0,
+ "step": 1240
+ },
+ {
+ "epoch": 3.0846824408468243,
+ "eval_entropy": 0.45185995916294497,
+ "eval_loss": 0.5672881603240967,
+ "eval_mean_token_accuracy": 0.8511318519364955,
+ "eval_num_tokens": 2894976.0,
+ "eval_runtime": 86.0819,
+ "eval_samples_per_second": 15.973,
+ "eval_steps_per_second": 1.998,
+ "step": 1240
+ },
+ {
+ "entropy": 0.3887945845723152,
+ "epoch": 3.1344956413449565,
+ "grad_norm": 0.7299330830574036,
+ "learning_rate": 0.0001963723276541939,
+ "loss": 0.32047903537750244,
+ "mean_token_accuracy": 0.8960984498262405,
+ "num_tokens": 2944401.0,
+ "step": 1260
+ },
+ {
+ "epoch": 3.1344956413449565,
+ "eval_entropy": 0.44865354549053105,
+ "eval_loss": 0.5666037201881409,
+ "eval_mean_token_accuracy": 0.8496572649063066,
+ "eval_num_tokens": 2944401.0,
+ "eval_runtime": 86.4858,
+ "eval_samples_per_second": 15.899,
+ "eval_steps_per_second": 1.989,
+ "step": 1260
+ },
+ {
+ "entropy": 0.39677664265036583,
+ "epoch": 3.1843088418430883,
+ "grad_norm": 0.9533219933509827,
+ "learning_rate": 0.00019502896390265838,
+ "loss": 0.3253983497619629,
+ "mean_token_accuracy": 0.8964207418262958,
+ "num_tokens": 2990243.0,
+ "step": 1280
+ },
+ {
+ "epoch": 3.1843088418430883,
+ "eval_entropy": 0.4641980809527774,
+ "eval_loss": 0.5814996957778931,
+ "eval_mean_token_accuracy": 0.8485886212005171,
+ "eval_num_tokens": 2990243.0,
+ "eval_runtime": 86.7784,
+ "eval_samples_per_second": 15.845,
+ "eval_steps_per_second": 1.982,
+ "step": 1280
+ },
+ {
+ "entropy": 0.39210722744464876,
+ "epoch": 3.2341220423412205,
+ "grad_norm": 0.7447651028633118,
+ "learning_rate": 0.00019366090347462545,
+ "loss": 0.3276803970336914,
+ "mean_token_accuracy": 0.8930055953562259,
+ "num_tokens": 3037248.0,
+ "step": 1300
+ },
+ {
+ "epoch": 3.2341220423412205,
+ "eval_entropy": 0.43595615254585135,
+ "eval_loss": 0.5722188353538513,
+ "eval_mean_token_accuracy": 0.8501105755567551,
+ "eval_num_tokens": 3037248.0,
+ "eval_runtime": 86.5271,
+ "eval_samples_per_second": 15.891,
+ "eval_steps_per_second": 1.988,
+ "step": 1300
+ },
+ {
+ "entropy": 0.3684127271175385,
+ "epoch": 3.2839352428393527,
+ "grad_norm": 0.6934201121330261,
+ "learning_rate": 0.00019226855895846078,
+ "loss": 0.3156379222869873,
+ "mean_token_accuracy": 0.8976306475698947,
+ "num_tokens": 3088676.0,
+ "step": 1320
+ },
+ {
+ "epoch": 3.2839352428393527,
+ "eval_entropy": 0.4628148723480313,
+ "eval_loss": 0.5631352066993713,
+ "eval_mean_token_accuracy": 0.8504934813394103,
+ "eval_num_tokens": 3088676.0,
+ "eval_runtime": 86.3436,
+ "eval_samples_per_second": 15.925,
+ "eval_steps_per_second": 1.992,
+ "step": 1320
+ },
+ {
+ "entropy": 0.4073401909321547,
+ "epoch": 3.3337484433374844,
+ "grad_norm": 0.9386897683143616,
+ "learning_rate": 0.00019085235026627994,
+ "loss": 0.34265310764312745,
+ "mean_token_accuracy": 0.8902062118053437,
+ "num_tokens": 3132874.0,
+ "step": 1340
+ },
+ {
+ "epoch": 3.3337484433374844,
+ "eval_entropy": 0.46455050623694133,
+ "eval_loss": 0.5586736798286438,
+ "eval_mean_token_accuracy": 0.8506874702004499,
+ "eval_num_tokens": 3132874.0,
+ "eval_runtime": 86.1286,
+ "eval_samples_per_second": 15.964,
+ "eval_steps_per_second": 1.997,
+ "step": 1340
+ },
+ {
+ "entropy": 0.4046429242938757,
+ "epoch": 3.383561643835616,
+ "grad_norm": 0.9633992314338684,
+ "learning_rate": 0.00018941270450730836,
+ "loss": 0.33816893100738527,
+ "mean_token_accuracy": 0.8927541889250279,
+ "num_tokens": 3178055.0,
+ "step": 1360
+ },
+ {
+ "epoch": 3.383561643835616,
+ "eval_entropy": 0.46846531660750856,
+ "eval_loss": 0.561501681804657,
+ "eval_mean_token_accuracy": 0.8496256377114806,
+ "eval_num_tokens": 3178055.0,
+ "eval_runtime": 86.685,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1360
+ },
+ {
+ "entropy": 0.39872407019138334,
+ "epoch": 3.4333748443337484,
+ "grad_norm": 0.7786458730697632,
+ "learning_rate": 0.00018795005585907113,
+ "loss": 0.33342490196228025,
+ "mean_token_accuracy": 0.8944805048406124,
+ "num_tokens": 3223389.0,
+ "step": 1380
+ },
+ {
+ "epoch": 3.4333748443337484,
+ "eval_entropy": 0.42709505973860273,
+ "eval_loss": 0.5751848220825195,
+ "eval_mean_token_accuracy": 0.8507290447867194,
+ "eval_num_tokens": 3223389.0,
+ "eval_runtime": 86.6892,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 1380
+ },
+ {
+ "entropy": 0.3923338124528527,
+ "epoch": 3.4831880448318806,
+ "grad_norm": 0.9305956363677979,
+ "learning_rate": 0.0001864648454364511,
+ "loss": 0.33188116550445557,
+ "mean_token_accuracy": 0.8943330392241478,
+ "num_tokens": 3274096.0,
+ "step": 1400
+ },
+ {
+ "epoch": 3.4831880448318806,
+ "eval_entropy": 0.4386174779298694,
+ "eval_loss": 0.5680831074714661,
+ "eval_mean_token_accuracy": 0.8513129727784977,
+ "eval_num_tokens": 3274096.0,
+ "eval_runtime": 86.2671,
+ "eval_samples_per_second": 15.939,
+ "eval_steps_per_second": 1.994,
+ "step": 1400
+ },
+ {
+ "entropy": 0.3856233984231949,
+ "epoch": 3.5330012453300124,
+ "grad_norm": 1.0362752676010132,
+ "learning_rate": 0.0001849575211586545,
+ "loss": 0.33098697662353516,
+ "mean_token_accuracy": 0.8961390435695649,
+ "num_tokens": 3322044.0,
+ "step": 1420
+ },
+ {
+ "epoch": 3.5330012453300124,
+ "eval_entropy": 0.4574795474493226,
+ "eval_loss": 0.5630439519882202,
+ "eval_mean_token_accuracy": 0.8520988873964133,
+ "eval_num_tokens": 3322044.0,
+ "eval_runtime": 86.6035,
+ "eval_samples_per_second": 15.877,
+ "eval_steps_per_second": 1.986,
+ "step": 1420
+ },
+ {
+ "entropy": 0.39812871962785723,
+ "epoch": 3.5828144458281446,
+ "grad_norm": 0.7807195782661438,
+ "learning_rate": 0.0001834285376141247,
+ "loss": 0.3333771228790283,
+ "mean_token_accuracy": 0.8930827379226685,
+ "num_tokens": 3369147.0,
+ "step": 1440
+ },
+ {
+ "epoch": 3.5828144458281446,
+ "eval_entropy": 0.4556825893909432,
+ "eval_loss": 0.5689062476158142,
+ "eval_mean_token_accuracy": 0.8507103507601937,
+ "eval_num_tokens": 3369147.0,
+ "eval_runtime": 86.1606,
+ "eval_samples_per_second": 15.959,
+ "eval_steps_per_second": 1.996,
+ "step": 1440
+ },
+ {
+ "entropy": 0.4147744856774807,
+ "epoch": 3.6326276463262763,
+ "grad_norm": 0.6429352164268494,
+ "learning_rate": 0.00018187835592344443,
+ "loss": 0.3482560873031616,
+ "mean_token_accuracy": 0.8910200245678425,
+ "num_tokens": 3415600.0,
+ "step": 1460
+ },
+ {
+ "epoch": 3.6326276463262763,
+ "eval_entropy": 0.46600024540757023,
+ "eval_loss": 0.5609709024429321,
+ "eval_mean_token_accuracy": 0.8491220876227977,
+ "eval_num_tokens": 3415600.0,
+ "eval_runtime": 86.8039,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1460
+ },
+ {
+ "entropy": 0.40425071083009245,
+ "epoch": 3.6824408468244085,
+ "grad_norm": 0.8613698482513428,
+ "learning_rate": 0.0001803074436002682,
+ "loss": 0.342916464805603,
+ "mean_token_accuracy": 0.8916418336331844,
+ "num_tokens": 3460471.0,
+ "step": 1480
+ },
+ {
+ "epoch": 3.6824408468244085,
+ "eval_entropy": 0.43855057899342026,
+ "eval_loss": 0.5720968246459961,
+ "eval_mean_token_accuracy": 0.8500823641932288,
+ "eval_num_tokens": 3460471.0,
+ "eval_runtime": 86.6746,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1480
+ },
+ {
+ "entropy": 0.39465143866837027,
+ "epoch": 3.7322540473225407,
+ "grad_norm": 0.6285189986228943,
+ "learning_rate": 0.0001787162744103265,
+ "loss": 0.3424591779708862,
+ "mean_token_accuracy": 0.8906558901071548,
+ "num_tokens": 3507647.0,
+ "step": 1500
+ },
+ {
+ "epoch": 3.7322540473225407,
+ "eval_entropy": 0.4509461877304454,
+ "eval_loss": 0.5590082406997681,
+ "eval_mean_token_accuracy": 0.8511747371318729,
+ "eval_num_tokens": 3507647.0,
+ "eval_runtime": 86.8126,
+ "eval_samples_per_second": 15.839,
+ "eval_steps_per_second": 1.981,
+ "step": 1500
+ },
+ {
+ "entropy": 0.4021005939692259,
+ "epoch": 3.7820672478206725,
+ "grad_norm": 0.8821248412132263,
+ "learning_rate": 0.00017710532822854468,
+ "loss": 0.3462103843688965,
+ "mean_token_accuracy": 0.889109355956316,
+ "num_tokens": 3548934.0,
+ "step": 1520
+ },
+ {
+ "epoch": 3.7820672478206725,
+ "eval_entropy": 0.4502199075596277,
+ "eval_loss": 0.566046416759491,
+ "eval_mean_token_accuracy": 0.8501714208098345,
+ "eval_num_tokens": 3548934.0,
+ "eval_runtime": 86.8336,
+ "eval_samples_per_second": 15.835,
+ "eval_steps_per_second": 1.981,
+ "step": 1520
+ },
+ {
+ "entropy": 0.4017397932708263,
+ "epoch": 3.8318804483188043,
+ "grad_norm": 0.8400952816009521,
+ "learning_rate": 0.0001754750908943189,
+ "loss": 0.34890995025634763,
+ "mean_token_accuracy": 0.8892098367214203,
+ "num_tokens": 3597186.0,
+ "step": 1540
+ },
+ {
+ "epoch": 3.8318804483188043,
+ "eval_entropy": 0.4614003023435903,
+ "eval_loss": 0.5617933869361877,
+ "eval_mean_token_accuracy": 0.8515863616106122,
+ "eval_num_tokens": 3597186.0,
+ "eval_runtime": 86.4609,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 1540
+ },
+ {
+ "entropy": 0.4112051840871572,
+ "epoch": 3.8816936488169365,
+ "grad_norm": 0.769478440284729,
+ "learning_rate": 0.0001738260540649939,
+ "loss": 0.34711437225341796,
+ "mean_token_accuracy": 0.8911717928946018,
+ "num_tokens": 3646646.0,
+ "step": 1560
+ },
+ {
+ "epoch": 3.8816936488169365,
+ "eval_entropy": 0.4540443811998811,
+ "eval_loss": 0.5576469898223877,
+ "eval_mean_token_accuracy": 0.8512079674144124,
+ "eval_num_tokens": 3646646.0,
+ "eval_runtime": 86.5103,
+ "eval_samples_per_second": 15.894,
+ "eval_steps_per_second": 1.988,
+ "step": 1560
+ },
+ {
+ "entropy": 0.41105241514742374,
+ "epoch": 3.9315068493150687,
+ "grad_norm": 0.8468427062034607,
+ "learning_rate": 0.00017215871506758568,
+ "loss": 0.3433023452758789,
+ "mean_token_accuracy": 0.8898739732801915,
+ "num_tokens": 3689560.0,
+ "step": 1580
+ },
+ {
+ "epoch": 3.9315068493150687,
+ "eval_entropy": 0.4707539707075718,
+ "eval_loss": 0.5641466379165649,
+ "eval_mean_token_accuracy": 0.8495440957851188,
+ "eval_num_tokens": 3689560.0,
+ "eval_runtime": 86.609,
+ "eval_samples_per_second": 15.876,
+ "eval_steps_per_second": 1.986,
+ "step": 1580
+ },
+ {
+ "entropy": 0.41016379147768023,
+ "epoch": 3.9813200498132004,
+ "grad_norm": 0.7482675313949585,
+ "learning_rate": 0.0001704735767487946,
+ "loss": 0.34550890922546384,
+ "mean_token_accuracy": 0.8893028847873211,
+ "num_tokens": 3736533.0,
+ "step": 1600
+ },
+ {
+ "epoch": 3.9813200498132004,
+ "eval_entropy": 0.46391099864660307,
+ "eval_loss": 0.5593640804290771,
+ "eval_mean_token_accuracy": 0.8510130581467651,
+ "eval_num_tokens": 3736533.0,
+ "eval_runtime": 86.3975,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 1600
+ },
+ {
+ "entropy": 0.33167599791135544,
+ "epoch": 4.029887920298879,
+ "grad_norm": 0.9435692429542542,
+ "learning_rate": 0.00016877114732335337,
+ "loss": 0.2716026544570923,
+ "mean_token_accuracy": 0.9133149828666296,
+ "num_tokens": 3783985.0,
+ "step": 1620
+ },
+ {
+ "epoch": 4.029887920298879,
+ "eval_entropy": 0.38499350005457567,
+ "eval_loss": 0.6298249363899231,
+ "eval_mean_token_accuracy": 0.8488117071778275,
+ "eval_num_tokens": 3783985.0,
+ "eval_runtime": 86.2933,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1620
+ },
+ {
+ "entropy": 0.3000166634097695,
+ "epoch": 4.0797011207970115,
+ "grad_norm": 0.8080845475196838,
+ "learning_rate": 0.0001670519402207569,
+ "loss": 0.22617182731628419,
+ "mean_token_accuracy": 0.9253474645316601,
+ "num_tokens": 3828830.0,
+ "step": 1640
+ },
+ {
+ "epoch": 4.0797011207970115,
+ "eval_entropy": 0.370110988703578,
+ "eval_loss": 0.6338461637496948,
+ "eval_mean_token_accuracy": 0.8485634801692741,
+ "eval_num_tokens": 3828830.0,
+ "eval_runtime": 85.9508,
+ "eval_samples_per_second": 15.998,
+ "eval_steps_per_second": 2.001,
+ "step": 1640
+ },
+ {
+ "entropy": 0.2986910421401262,
+ "epoch": 4.129514321295143,
+ "grad_norm": 0.7310900092124939,
+ "learning_rate": 0.0001653164739304185,
+ "loss": 0.22367463111877442,
+ "mean_token_accuracy": 0.9252275295555592,
+ "num_tokens": 3878616.0,
+ "step": 1660
+ },
+ {
+ "epoch": 4.129514321295143,
+ "eval_entropy": 0.3944379702037157,
+ "eval_loss": 0.6109381914138794,
+ "eval_mean_token_accuracy": 0.849291454220927,
+ "eval_num_tokens": 3878616.0,
+ "eval_runtime": 86.6728,
+ "eval_samples_per_second": 15.864,
+ "eval_steps_per_second": 1.984,
+ "step": 1660
+ },
+ {
+ "entropy": 0.3095553796738386,
+ "epoch": 4.179327521793275,
+ "grad_norm": 0.7059140801429749,
+ "learning_rate": 0.0001635652718453007,
+ "loss": 0.23651680946350098,
+ "mean_token_accuracy": 0.9208931416273117,
+ "num_tokens": 3924763.0,
+ "step": 1680
+ },
+ {
+ "epoch": 4.179327521793275,
+ "eval_entropy": 0.3910588648949945,
+ "eval_loss": 0.6104469299316406,
+ "eval_mean_token_accuracy": 0.8486883893262508,
+ "eval_num_tokens": 3924763.0,
+ "eval_runtime": 86.7612,
+ "eval_samples_per_second": 15.848,
+ "eval_steps_per_second": 1.982,
+ "step": 1680
+ },
+ {
+ "entropy": 0.3001101028174162,
+ "epoch": 4.229140722291407,
+ "grad_norm": 0.6787802577018738,
+ "learning_rate": 0.00016179886210406728,
+ "loss": 0.23130471706390382,
+ "mean_token_accuracy": 0.9233332790434361,
+ "num_tokens": 3967474.0,
+ "step": 1700
+ },
+ {
+ "epoch": 4.229140722291407,
+ "eval_entropy": 0.3794369170832079,
+ "eval_loss": 0.6182110905647278,
+ "eval_mean_token_accuracy": 0.8495433777570724,
+ "eval_num_tokens": 3967474.0,
+ "eval_runtime": 85.94,
+ "eval_samples_per_second": 16.0,
+ "eval_steps_per_second": 2.001,
+ "step": 1700
+ },
+ {
+ "entropy": 0.3031421799212694,
+ "epoch": 4.2789539227895395,
+ "grad_norm": 0.9732038378715515,
+ "learning_rate": 0.0001600177774318036,
+ "loss": 0.2359529733657837,
+ "mean_token_accuracy": 0.9217648565769195,
+ "num_tokens": 4013170.0,
+ "step": 1720
+ },
+ {
+ "epoch": 4.2789539227895395,
+ "eval_entropy": 0.3923123094231583,
+ "eval_loss": 0.6057384610176086,
+ "eval_mean_token_accuracy": 0.8508818288182103,
+ "eval_num_tokens": 4013170.0,
+ "eval_runtime": 86.7647,
+ "eval_samples_per_second": 15.847,
+ "eval_steps_per_second": 1.982,
+ "step": 1720
+ },
+ {
+ "entropy": 0.29365369994193313,
+ "epoch": 4.328767123287671,
+ "grad_norm": 0.7681498527526855,
+ "learning_rate": 0.0001582225549793541,
+ "loss": 0.2269371747970581,
+ "mean_token_accuracy": 0.9245341829955578,
+ "num_tokens": 4062594.0,
+ "step": 1740
+ },
+ {
+ "epoch": 4.328767123287671,
+ "eval_entropy": 0.4011661055129628,
+ "eval_loss": 0.6144486665725708,
+ "eval_mean_token_accuracy": 0.8480324357054955,
+ "eval_num_tokens": 4062594.0,
+ "eval_runtime": 87.1306,
+ "eval_samples_per_second": 15.781,
+ "eval_steps_per_second": 1.974,
+ "step": 1740
+ },
+ {
+ "entropy": 0.29396994728595016,
+ "epoch": 4.378580323785803,
+ "grad_norm": 1.0001007318496704,
+ "learning_rate": 0.0001564137361613248,
+ "loss": 0.22777395248413085,
+ "mean_token_accuracy": 0.9262309700250626,
+ "num_tokens": 4110719.0,
+ "step": 1760
+ },
+ {
+ "epoch": 4.378580323785803,
+ "eval_entropy": 0.38518730195802314,
+ "eval_loss": 0.6202630400657654,
+ "eval_mean_token_accuracy": 0.8493869807137999,
+ "eval_num_tokens": 4110719.0,
+ "eval_runtime": 86.6616,
+ "eval_samples_per_second": 15.866,
+ "eval_steps_per_second": 1.985,
+ "step": 1760
+ },
+ {
+ "entropy": 0.3096018506214023,
+ "epoch": 4.428393524283935,
+ "grad_norm": 1.0448365211486816,
+ "learning_rate": 0.00015459186649280024,
+ "loss": 0.23696351051330566,
+ "mean_token_accuracy": 0.9217322513461113,
+ "num_tokens": 4156827.0,
+ "step": 1780
+ },
+ {
+ "epoch": 4.428393524283935,
+ "eval_entropy": 0.3946371126140273,
+ "eval_loss": 0.6079026460647583,
+ "eval_mean_token_accuracy": 0.8492515852978063,
+ "eval_num_tokens": 4156827.0,
+ "eval_runtime": 86.6582,
+ "eval_samples_per_second": 15.867,
+ "eval_steps_per_second": 1.985,
+ "step": 1780
+ },
+ {
+ "entropy": 0.32619857545942066,
+ "epoch": 4.478206724782067,
+ "grad_norm": 0.7210651636123657,
+ "learning_rate": 0.00015275749542482337,
+ "loss": 0.24651215076446534,
+ "mean_token_accuracy": 0.9177676141262054,
+ "num_tokens": 4200878.0,
+ "step": 1800
+ },
+ {
+ "epoch": 4.478206724782067,
+ "eval_entropy": 0.3947690814560236,
+ "eval_loss": 0.6065912246704102,
+ "eval_mean_token_accuracy": 0.8502957744653835,
+ "eval_num_tokens": 4200878.0,
+ "eval_runtime": 86.5959,
+ "eval_samples_per_second": 15.878,
+ "eval_steps_per_second": 1.986,
+ "step": 1800
+ },
+ {
+ "entropy": 0.3193941755220294,
+ "epoch": 4.5280199252802,
+ "grad_norm": 0.8281906843185425,
+ "learning_rate": 0.0001509111761786888,
+ "loss": 0.23936262130737304,
+ "mean_token_accuracy": 0.9201708927750587,
+ "num_tokens": 4244423.0,
+ "step": 1820
+ },
+ {
+ "epoch": 4.5280199252802,
+ "eval_entropy": 0.38704028864239537,
+ "eval_loss": 0.6006569266319275,
+ "eval_mean_token_accuracy": 0.8502406720505205,
+ "eval_num_tokens": 4244423.0,
+ "eval_runtime": 86.8059,
+ "eval_samples_per_second": 15.84,
+ "eval_steps_per_second": 1.981,
+ "step": 1820
+ },
+ {
+ "entropy": 0.3164879363030195,
+ "epoch": 4.577833125778331,
+ "grad_norm": 0.7892968654632568,
+ "learning_rate": 0.00014905346557909867,
+ "loss": 0.24541733264923096,
+ "mean_token_accuracy": 0.9175932116806507,
+ "num_tokens": 4289773.0,
+ "step": 1840
+ },
+ {
+ "epoch": 4.577833125778331,
+ "eval_entropy": 0.38861122120951497,
+ "eval_loss": 0.6115967631340027,
+ "eval_mean_token_accuracy": 0.849471275196519,
+ "eval_num_tokens": 4289773.0,
+ "eval_runtime": 86.2946,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 1840
+ },
+ {
+ "entropy": 0.3051785985007882,
+ "epoch": 4.627646326276463,
+ "grad_norm": 0.8109654188156128,
+ "learning_rate": 0.0001471849238862319,
+ "loss": 0.23433220386505127,
+ "mean_token_accuracy": 0.9206570319831371,
+ "num_tokens": 4336894.0,
+ "step": 1860
+ },
+ {
+ "epoch": 4.627646326276463,
+ "eval_entropy": 0.37162452295076015,
+ "eval_loss": 0.6184061765670776,
+ "eval_mean_token_accuracy": 0.8501173268223918,
+ "eval_num_tokens": 4336894.0,
+ "eval_runtime": 86.6865,
+ "eval_samples_per_second": 15.862,
+ "eval_steps_per_second": 1.984,
+ "step": 1860
+ },
+ {
+ "entropy": 0.3168198253959417,
+ "epoch": 4.677459526774595,
+ "grad_norm": 0.9512342214584351,
+ "learning_rate": 0.0001453061146267775,
+ "loss": 0.23832404613494873,
+ "mean_token_accuracy": 0.9197044663131237,
+ "num_tokens": 4382947.0,
+ "step": 1880
+ },
+ {
+ "epoch": 4.677459526774595,
+ "eval_entropy": 0.3845940856912801,
+ "eval_loss": 0.606762707233429,
+ "eval_mean_token_accuracy": 0.8504838194957999,
+ "eval_num_tokens": 4382947.0,
+ "eval_runtime": 86.5175,
+ "eval_samples_per_second": 15.893,
+ "eval_steps_per_second": 1.988,
+ "step": 1880
+ },
+ {
+ "entropy": 0.30791807882487776,
+ "epoch": 4.7272727272727275,
+ "grad_norm": 0.8123113512992859,
+ "learning_rate": 0.00014341760442398248,
+ "loss": 0.2395785331726074,
+ "mean_token_accuracy": 0.918928150832653,
+ "num_tokens": 4433050.0,
+ "step": 1900
+ },
+ {
+ "epoch": 4.7272727272727275,
+ "eval_entropy": 0.39762327222283494,
+ "eval_loss": 0.5994202494621277,
+ "eval_mean_token_accuracy": 0.8509274201337681,
+ "eval_num_tokens": 4433050.0,
+ "eval_runtime": 86.2873,
+ "eval_samples_per_second": 15.935,
+ "eval_steps_per_second": 1.993,
+ "step": 1900
+ },
+ {
+ "entropy": 0.3021434534341097,
+ "epoch": 4.777085927770859,
+ "grad_norm": 0.731787383556366,
+ "learning_rate": 0.000141519962826766,
+ "loss": 0.23494718074798585,
+ "mean_token_accuracy": 0.9201403826475143,
+ "num_tokens": 4483598.0,
+ "step": 1920
+ },
+ {
+ "epoch": 4.777085927770859,
+ "eval_entropy": 0.3827026732439219,
+ "eval_loss": 0.5995895862579346,
+ "eval_mean_token_accuracy": 0.851468373523202,
+ "eval_num_tokens": 4483598.0,
+ "eval_runtime": 86.3006,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 1920
+ },
+ {
+ "entropy": 0.31626159623265265,
+ "epoch": 4.826899128268991,
+ "grad_norm": 0.8848487138748169,
+ "learning_rate": 0.00013961376213795132,
+ "loss": 0.2439030647277832,
+ "mean_token_accuracy": 0.9196575872600079,
+ "num_tokens": 4529201.0,
+ "step": 1940
+ },
+ {
+ "epoch": 4.826899128268991,
+ "eval_entropy": 0.388698436839636,
+ "eval_loss": 0.6000174283981323,
+ "eval_mean_token_accuracy": 0.8518068187458571,
+ "eval_num_tokens": 4529201.0,
+ "eval_runtime": 86.8979,
+ "eval_samples_per_second": 15.823,
+ "eval_steps_per_second": 1.979,
+ "step": 1940
+ },
+ {
+ "entropy": 0.30520407035946845,
+ "epoch": 4.876712328767123,
+ "grad_norm": 0.8532460927963257,
+ "learning_rate": 0.00013769957724166695,
+ "loss": 0.23458616733551024,
+ "mean_token_accuracy": 0.9221912942826748,
+ "num_tokens": 4578167.0,
+ "step": 1960
+ },
+ {
+ "epoch": 4.876712328767123,
+ "eval_entropy": 0.38777847102908203,
+ "eval_loss": 0.6004981398582458,
+ "eval_mean_token_accuracy": 0.8516481768253238,
+ "eval_num_tokens": 4578167.0,
+ "eval_runtime": 87.0777,
+ "eval_samples_per_second": 15.791,
+ "eval_steps_per_second": 1.975,
+ "step": 1960
+ },
+ {
+ "entropy": 0.3226448342204094,
+ "epoch": 4.926525529265255,
+ "grad_norm": 0.6945561766624451,
+ "learning_rate": 0.0001357779854299694,
+ "loss": 0.24048397541046143,
+ "mean_token_accuracy": 0.9195300146937371,
+ "num_tokens": 4622316.0,
+ "step": 1980
+ },
+ {
+ "epoch": 4.926525529265255,
+ "eval_entropy": 0.38581624263247777,
+ "eval_loss": 0.6029234528541565,
+ "eval_mean_token_accuracy": 0.8514213260523108,
+ "eval_num_tokens": 4622316.0,
+ "eval_runtime": 85.8729,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 1980
+ },
+ {
+ "entropy": 0.3051655298098922,
+ "epoch": 4.976338729763388,
+ "grad_norm": 0.7976452708244324,
+ "learning_rate": 0.00013384956622874001,
+ "loss": 0.23584742546081544,
+ "mean_token_accuracy": 0.9216851457953453,
+ "num_tokens": 4670746.0,
+ "step": 2000
+ },
+ {
+ "epoch": 4.976338729763388,
+ "eval_entropy": 0.37913159246361533,
+ "eval_loss": 0.6057604551315308,
+ "eval_mean_token_accuracy": 0.8525801203971686,
+ "eval_num_tokens": 4670746.0,
+ "eval_runtime": 86.1145,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2000
+ },
+ {
+ "entropy": 0.27438195240803254,
+ "epoch": 5.024906600249066,
+ "grad_norm": 0.6729586124420166,
+ "learning_rate": 0.0001319149012229075,
+ "loss": 0.19775952100753785,
+ "mean_token_accuracy": 0.9339428559327737,
+ "num_tokens": 4716176.0,
+ "step": 2020
+ },
+ {
+ "epoch": 5.024906600249066,
+ "eval_entropy": 0.3448961910813354,
+ "eval_loss": 0.6750120520591736,
+ "eval_mean_token_accuracy": 0.8487970232963562,
+ "eval_num_tokens": 4716176.0,
+ "eval_runtime": 86.1169,
+ "eval_samples_per_second": 15.967,
+ "eval_steps_per_second": 1.997,
+ "step": 2020
+ },
+ {
+ "entropy": 0.21423916313797237,
+ "epoch": 5.074719800747198,
+ "grad_norm": 0.6934391856193542,
+ "learning_rate": 0.00012997457388105022,
+ "loss": 0.1439570426940918,
+ "mean_token_accuracy": 0.9528236843645572,
+ "num_tokens": 4763269.0,
+ "step": 2040
+ },
+ {
+ "epoch": 5.074719800747198,
+ "eval_entropy": 0.3570949243771475,
+ "eval_loss": 0.6465504169464111,
+ "eval_mean_token_accuracy": 0.8490785547467166,
+ "eval_num_tokens": 4763269.0,
+ "eval_runtime": 85.9574,
+ "eval_samples_per_second": 15.996,
+ "eval_steps_per_second": 2.001,
+ "step": 2040
+ },
+ {
+ "entropy": 0.20838565267622472,
+ "epoch": 5.12453300124533,
+ "grad_norm": 0.7286986112594604,
+ "learning_rate": 0.00012802916937942972,
+ "loss": 0.14467307329177856,
+ "mean_token_accuracy": 0.950994835793972,
+ "num_tokens": 4809047.0,
+ "step": 2060
+ },
+ {
+ "epoch": 5.12453300124533,
+ "eval_entropy": 0.3452463157821533,
+ "eval_loss": 0.6705958843231201,
+ "eval_mean_token_accuracy": 0.8490352796953778,
+ "eval_num_tokens": 4809047.0,
+ "eval_runtime": 86.228,
+ "eval_samples_per_second": 15.946,
+ "eval_steps_per_second": 1.995,
+ "step": 2060
+ },
+ {
+ "entropy": 0.20453082229942082,
+ "epoch": 5.174346201743462,
+ "grad_norm": 0.7515555620193481,
+ "learning_rate": 0.00012607927442550974,
+ "loss": 0.13732000589370727,
+ "mean_token_accuracy": 0.9537357829511166,
+ "num_tokens": 4857965.0,
+ "step": 2080
+ },
+ {
+ "epoch": 5.174346201743462,
+ "eval_entropy": 0.32431264914745506,
+ "eval_loss": 0.6743043065071106,
+ "eval_mean_token_accuracy": 0.8504878629085629,
+ "eval_num_tokens": 4857965.0,
+ "eval_runtime": 86.5948,
+ "eval_samples_per_second": 15.879,
+ "eval_steps_per_second": 1.986,
+ "step": 2080
+ },
+ {
+ "entropy": 0.21812320686876774,
+ "epoch": 5.224159402241594,
+ "grad_norm": 0.9093465209007263,
+ "learning_rate": 0.0001241254770810132,
+ "loss": 0.14311420917510986,
+ "mean_token_accuracy": 0.9514068141579628,
+ "num_tokens": 4905151.0,
+ "step": 2100
+ },
+ {
+ "epoch": 5.224159402241594,
+ "eval_entropy": 0.33086285835435225,
+ "eval_loss": 0.6676449179649353,
+ "eval_mean_token_accuracy": 0.8505287662495015,
+ "eval_num_tokens": 4905151.0,
+ "eval_runtime": 86.1253,
+ "eval_samples_per_second": 15.965,
+ "eval_steps_per_second": 1.997,
+ "step": 2100
+ },
+ {
+ "entropy": 0.2180163251236081,
+ "epoch": 5.273972602739726,
+ "grad_norm": 0.6703007221221924,
+ "learning_rate": 0.00012216836658457075,
+ "loss": 0.14803968667984008,
+ "mean_token_accuracy": 0.9521303348243236,
+ "num_tokens": 4947072.0,
+ "step": 2120
+ },
+ {
+ "epoch": 5.273972602739726,
+ "eval_entropy": 0.33162341708707255,
+ "eval_loss": 0.6658875942230225,
+ "eval_mean_token_accuracy": 0.8500757605530495,
+ "eval_num_tokens": 4947072.0,
+ "eval_runtime": 86.6296,
+ "eval_samples_per_second": 15.872,
+ "eval_steps_per_second": 1.985,
+ "step": 2120
+ },
+ {
+ "entropy": 0.22511130161583423,
+ "epoch": 5.323785803237858,
+ "grad_norm": 0.8078880906105042,
+ "learning_rate": 0.00012020853317401455,
+ "loss": 0.15228408575057983,
+ "mean_token_accuracy": 0.947144789993763,
+ "num_tokens": 4991974.0,
+ "step": 2140
+ },
+ {
+ "epoch": 5.323785803237858,
+ "eval_entropy": 0.3354601170434508,
+ "eval_loss": 0.6677829623222351,
+ "eval_mean_token_accuracy": 0.8482600024273229,
+ "eval_num_tokens": 4991974.0,
+ "eval_runtime": 86.4689,
+ "eval_samples_per_second": 15.902,
+ "eval_steps_per_second": 1.989,
+ "step": 2140
+ },
+ {
+ "entropy": 0.2244176059961319,
+ "epoch": 5.37359900373599,
+ "grad_norm": 0.9636075496673584,
+ "learning_rate": 0.00011824656790837037,
+ "loss": 0.15260883569717407,
+ "mean_token_accuracy": 0.9471467643976211,
+ "num_tokens": 5038400.0,
+ "step": 2160
+ },
+ {
+ "epoch": 5.37359900373599,
+ "eval_entropy": 0.3381616926297199,
+ "eval_loss": 0.6694412231445312,
+ "eval_mean_token_accuracy": 0.8482369603805764,
+ "eval_num_tokens": 5038400.0,
+ "eval_runtime": 86.4147,
+ "eval_samples_per_second": 15.912,
+ "eval_steps_per_second": 1.99,
+ "step": 2160
+ },
+ {
+ "entropy": 0.22982364390045404,
+ "epoch": 5.423412204234122,
+ "grad_norm": 0.775401771068573,
+ "learning_rate": 0.00011628306248960262,
+ "loss": 0.15140302181243898,
+ "mean_token_accuracy": 0.9492553934454918,
+ "num_tokens": 5083166.0,
+ "step": 2180
+ },
+ {
+ "epoch": 5.423412204234122,
+ "eval_entropy": 0.3305150235808173,
+ "eval_loss": 0.6717822551727295,
+ "eval_mean_token_accuracy": 0.8489849723355715,
+ "eval_num_tokens": 5083166.0,
+ "eval_runtime": 86.4728,
+ "eval_samples_per_second": 15.901,
+ "eval_steps_per_second": 1.989,
+ "step": 2180
+ },
+ {
+ "entropy": 0.21448935717344284,
+ "epoch": 5.473225404732254,
+ "grad_norm": 0.6575281023979187,
+ "learning_rate": 0.00011431860908416465,
+ "loss": 0.1452319622039795,
+ "mean_token_accuracy": 0.9505287684500218,
+ "num_tokens": 5135109.0,
+ "step": 2200
+ },
+ {
+ "epoch": 5.473225404732254,
+ "eval_entropy": 0.3488145174328671,
+ "eval_loss": 0.6612305641174316,
+ "eval_mean_token_accuracy": 0.8492907808963642,
+ "eval_num_tokens": 5135109.0,
+ "eval_runtime": 86.6927,
+ "eval_samples_per_second": 15.861,
+ "eval_steps_per_second": 1.984,
+ "step": 2200
+ },
+ {
+ "entropy": 0.23091202937066554,
+ "epoch": 5.523038605230386,
+ "grad_norm": 0.8909686207771301,
+ "learning_rate": 0.00011235380014440985,
+ "loss": 0.15150139331817628,
+ "mean_token_accuracy": 0.9497875183820724,
+ "num_tokens": 5180138.0,
+ "step": 2220
+ },
+ {
+ "epoch": 5.523038605230386,
+ "eval_entropy": 0.3268539015810157,
+ "eval_loss": 0.6667542457580566,
+ "eval_mean_token_accuracy": 0.8499062903398691,
+ "eval_num_tokens": 5180138.0,
+ "eval_runtime": 86.4644,
+ "eval_samples_per_second": 15.903,
+ "eval_steps_per_second": 1.989,
+ "step": 2220
+ },
+ {
+ "entropy": 0.2227974807843566,
+ "epoch": 5.572851805728518,
+ "grad_norm": 0.6180275082588196,
+ "learning_rate": 0.0001103892282299158,
+ "loss": 0.1491069197654724,
+ "mean_token_accuracy": 0.9488144010305405,
+ "num_tokens": 5226864.0,
+ "step": 2240
+ },
+ {
+ "epoch": 5.572851805728518,
+ "eval_entropy": 0.3346347655494546,
+ "eval_loss": 0.6665948629379272,
+ "eval_mean_token_accuracy": 0.8499961893918903,
+ "eval_num_tokens": 5226864.0,
+ "eval_runtime": 87.0548,
+ "eval_samples_per_second": 15.795,
+ "eval_steps_per_second": 1.976,
+ "step": 2240
+ },
+ {
+ "entropy": 0.21368421968072654,
+ "epoch": 5.62266500622665,
+ "grad_norm": 0.6004369258880615,
+ "learning_rate": 0.00010842548582877651,
+ "loss": 0.14485255479812623,
+ "mean_token_accuracy": 0.9502056457102299,
+ "num_tokens": 5276602.0,
+ "step": 2260
+ },
+ {
+ "epoch": 5.62266500622665,
+ "eval_entropy": 0.32753298804163933,
+ "eval_loss": 0.6680151224136353,
+ "eval_mean_token_accuracy": 0.8515451086121936,
+ "eval_num_tokens": 5276602.0,
+ "eval_runtime": 86.8524,
+ "eval_samples_per_second": 15.831,
+ "eval_steps_per_second": 1.98,
+ "step": 2260
+ },
+ {
+ "entropy": 0.2103635374456644,
+ "epoch": 5.672478206724782,
+ "grad_norm": 0.699174702167511,
+ "learning_rate": 0.00010646316517891613,
+ "loss": 0.14297772645950318,
+ "mean_token_accuracy": 0.9512537539005279,
+ "num_tokens": 5323718.0,
+ "step": 2280
+ },
+ {
+ "epoch": 5.672478206724782,
+ "eval_entropy": 0.32966585959806,
+ "eval_loss": 0.675578773021698,
+ "eval_mean_token_accuracy": 0.8509623023659684,
+ "eval_num_tokens": 5323718.0,
+ "eval_runtime": 86.4518,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2280
+ },
+ {
+ "entropy": 0.22516900151968003,
+ "epoch": 5.722291407222914,
+ "grad_norm": 0.6637354493141174,
+ "learning_rate": 0.00010450285808947797,
+ "loss": 0.15202572345733642,
+ "mean_token_accuracy": 0.9482452072203159,
+ "num_tokens": 5369039.0,
+ "step": 2300
+ },
+ {
+ "epoch": 5.722291407222914,
+ "eval_entropy": 0.3369456917740578,
+ "eval_loss": 0.6697061061859131,
+ "eval_mean_token_accuracy": 0.848603522361711,
+ "eval_num_tokens": 5369039.0,
+ "eval_runtime": 86.6371,
+ "eval_samples_per_second": 15.871,
+ "eval_steps_per_second": 1.985,
+ "step": 2300
+ },
+ {
+ "entropy": 0.21841065725311637,
+ "epoch": 5.772104607721046,
+ "grad_norm": 0.7940268516540527,
+ "learning_rate": 0.00010254515576234297,
+ "loss": 0.14710167646408082,
+ "mean_token_accuracy": 0.9493498183786869,
+ "num_tokens": 5417029.0,
+ "step": 2320
+ },
+ {
+ "epoch": 5.772104607721046,
+ "eval_entropy": 0.3237486180177955,
+ "eval_loss": 0.6779657602310181,
+ "eval_mean_token_accuracy": 0.8500715313955794,
+ "eval_num_tokens": 5417029.0,
+ "eval_runtime": 86.1826,
+ "eval_samples_per_second": 15.954,
+ "eval_steps_per_second": 1.996,
+ "step": 2320
+ },
+ {
+ "entropy": 0.22146204356104135,
+ "epoch": 5.821917808219178,
+ "grad_norm": 0.9234833121299744,
+ "learning_rate": 0.00010059064861383132,
+ "loss": 0.14720046520233154,
+ "mean_token_accuracy": 0.9493872679769992,
+ "num_tokens": 5461671.0,
+ "step": 2340
+ },
+ {
+ "epoch": 5.821917808219178,
+ "eval_entropy": 0.32365207564692167,
+ "eval_loss": 0.6704005002975464,
+ "eval_mean_token_accuracy": 0.8507985760306203,
+ "eval_num_tokens": 5461671.0,
+ "eval_runtime": 86.5494,
+ "eval_samples_per_second": 15.887,
+ "eval_steps_per_second": 1.987,
+ "step": 2340
+ },
+ {
+ "entropy": 0.20934011954814197,
+ "epoch": 5.87173100871731,
+ "grad_norm": 0.5547503232955933,
+ "learning_rate": 9.863992609664084e-05,
+ "loss": 0.1464867353439331,
+ "mean_token_accuracy": 0.9503875687718392,
+ "num_tokens": 5509312.0,
+ "step": 2360
+ },
+ {
+ "epoch": 5.87173100871731,
+ "eval_entropy": 0.3330401429083458,
+ "eval_loss": 0.6659091114997864,
+ "eval_mean_token_accuracy": 0.8504848906467127,
+ "eval_num_tokens": 5509312.0,
+ "eval_runtime": 86.5855,
+ "eval_samples_per_second": 15.88,
+ "eval_steps_per_second": 1.986,
+ "step": 2360
+ },
+ {
+ "entropy": 0.21678635366261007,
+ "epoch": 5.921544209215442,
+ "grad_norm": 0.570612907409668,
+ "learning_rate": 9.669357652207635e-05,
+ "loss": 0.14821385145187377,
+ "mean_token_accuracy": 0.9503940217196941,
+ "num_tokens": 5558196.0,
+ "step": 2380
+ },
+ {
+ "epoch": 5.921544209215442,
+ "eval_entropy": 0.3322022325077722,
+ "eval_loss": 0.6722489595413208,
+ "eval_mean_token_accuracy": 0.8489979422369669,
+ "eval_num_tokens": 5558196.0,
+ "eval_runtime": 86.2986,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 2380
+ },
+ {
+ "entropy": 0.20932920072227718,
+ "epoch": 5.971357409713574,
+ "grad_norm": 0.7879557609558105,
+ "learning_rate": 9.475218688262262e-05,
+ "loss": 0.14675841331481934,
+ "mean_token_accuracy": 0.9507176131010056,
+ "num_tokens": 5605400.0,
+ "step": 2400
+ },
+ {
+ "epoch": 5.971357409713574,
+ "eval_entropy": 0.3199348642902319,
+ "eval_loss": 0.6698136329650879,
+ "eval_mean_token_accuracy": 0.8514142130003419,
+ "eval_num_tokens": 5605400.0,
+ "eval_runtime": 85.8995,
+ "eval_samples_per_second": 16.007,
+ "eval_steps_per_second": 2.002,
+ "step": 2400
+ },
+ {
+ "entropy": 0.21032143919131693,
+ "epoch": 6.019925280199253,
+ "grad_norm": 0.5823076367378235,
+ "learning_rate": 9.281634267491569e-05,
+ "loss": 0.13322267532348633,
+ "mean_token_accuracy": 0.9550939072401096,
+ "num_tokens": 5648968.0,
+ "step": 2420
+ },
+ {
+ "epoch": 6.019925280199253,
+ "eval_entropy": 0.30206270117399303,
+ "eval_loss": 0.7093168497085571,
+ "eval_mean_token_accuracy": 0.8500627639681794,
+ "eval_num_tokens": 5648968.0,
+ "eval_runtime": 85.8128,
+ "eval_samples_per_second": 16.023,
+ "eval_steps_per_second": 2.004,
+ "step": 2420
+ },
+ {
+ "entropy": 0.1534628233872354,
+ "epoch": 6.069738480697385,
+ "grad_norm": 0.710133969783783,
+ "learning_rate": 9.088662772316508e-05,
+ "loss": 0.09078952670097351,
+ "mean_token_accuracy": 0.9678447999060154,
+ "num_tokens": 5697633.0,
+ "step": 2440
+ },
+ {
+ "epoch": 6.069738480697385,
+ "eval_entropy": 0.28208133101809857,
+ "eval_loss": 0.7636417150497437,
+ "eval_mean_token_accuracy": 0.8494061477655588,
+ "eval_num_tokens": 5697633.0,
+ "eval_runtime": 85.9724,
+ "eval_samples_per_second": 15.994,
+ "eval_steps_per_second": 2.001,
+ "step": 2440
+ },
+ {
+ "entropy": 0.16151462448760867,
+ "epoch": 6.119551681195516,
+ "grad_norm": 0.5793812274932861,
+ "learning_rate": 8.896362400308028e-05,
+ "loss": 0.09545697569847107,
+ "mean_token_accuracy": 0.9671573750674725,
+ "num_tokens": 5745090.0,
+ "step": 2460
+ },
+ {
+ "epoch": 6.119551681195516,
+ "eval_entropy": 0.2833245605403601,
+ "eval_loss": 0.7402405738830566,
+ "eval_mean_token_accuracy": 0.8503523728875226,
+ "eval_num_tokens": 5745090.0,
+ "eval_runtime": 85.5461,
+ "eval_samples_per_second": 16.073,
+ "eval_steps_per_second": 2.011,
+ "step": 2460
+ },
+ {
+ "entropy": 0.15203177919611335,
+ "epoch": 6.169364881693649,
+ "grad_norm": 0.4251123368740082,
+ "learning_rate": 8.704791146635483e-05,
+ "loss": 0.09420782327651978,
+ "mean_token_accuracy": 0.9677386932075024,
+ "num_tokens": 5790333.0,
+ "step": 2480
+ },
+ {
+ "epoch": 6.169364881693649,
+ "eval_entropy": 0.28572545962971313,
+ "eval_loss": 0.735416829586029,
+ "eval_mean_token_accuracy": 0.8487084663884584,
+ "eval_num_tokens": 5790333.0,
+ "eval_runtime": 85.4801,
+ "eval_samples_per_second": 16.086,
+ "eval_steps_per_second": 2.012,
+ "step": 2480
+ },
+ {
+ "entropy": 0.15587336672469973,
+ "epoch": 6.219178082191781,
+ "grad_norm": 0.4357028007507324,
+ "learning_rate": 8.514006786576085e-05,
+ "loss": 0.09429320096969604,
+ "mean_token_accuracy": 0.9682952925562859,
+ "num_tokens": 5837321.0,
+ "step": 2500
+ },
+ {
+ "epoch": 6.219178082191781,
+ "eval_entropy": 0.2859006894882335,
+ "eval_loss": 0.7347224950790405,
+ "eval_mean_token_accuracy": 0.8501905518215757,
+ "eval_num_tokens": 5837321.0,
+ "eval_runtime": 85.7578,
+ "eval_samples_per_second": 16.034,
+ "eval_steps_per_second": 2.006,
+ "step": 2500
+ },
+ {
+ "entropy": 0.15765639198943973,
+ "epoch": 6.268991282689913,
+ "grad_norm": 0.47331130504608154,
+ "learning_rate": 8.324066858090663e-05,
+ "loss": 0.09571113586425781,
+ "mean_token_accuracy": 0.9683481335639954,
+ "num_tokens": 5884398.0,
+ "step": 2520
+ },
+ {
+ "epoch": 6.268991282689913,
+ "eval_entropy": 0.29231513846059176,
+ "eval_loss": 0.7392512559890747,
+ "eval_mean_token_accuracy": 0.8486633983462356,
+ "eval_num_tokens": 5884398.0,
+ "eval_runtime": 85.7846,
+ "eval_samples_per_second": 16.029,
+ "eval_steps_per_second": 2.005,
+ "step": 2520
+ },
+ {
+ "entropy": 0.16176860257983208,
+ "epoch": 6.318804483188045,
+ "grad_norm": 0.6142018437385559,
+ "learning_rate": 8.135028644470992e-05,
+ "loss": 0.09486144185066223,
+ "mean_token_accuracy": 0.9682316601276397,
+ "num_tokens": 5929876.0,
+ "step": 2540
+ },
+ {
+ "epoch": 6.318804483188045,
+ "eval_entropy": 0.2851274753379267,
+ "eval_loss": 0.7520816922187805,
+ "eval_mean_token_accuracy": 0.8501113649717597,
+ "eval_num_tokens": 5929876.0,
+ "eval_runtime": 85.9425,
+ "eval_samples_per_second": 15.999,
+ "eval_steps_per_second": 2.001,
+ "step": 2540
+ },
+ {
+ "entropy": 0.15404034564271568,
+ "epoch": 6.3686176836861765,
+ "grad_norm": 0.6051287651062012,
+ "learning_rate": 7.946949157063964e-05,
+ "loss": 0.09280472993850708,
+ "mean_token_accuracy": 0.9684635892510414,
+ "num_tokens": 5978490.0,
+ "step": 2560
+ },
+ {
+ "epoch": 6.3686176836861765,
+ "eval_entropy": 0.28802703563557114,
+ "eval_loss": 0.7439162135124207,
+ "eval_mean_token_accuracy": 0.8499851770872293,
+ "eval_num_tokens": 5978490.0,
+ "eval_runtime": 86.0703,
+ "eval_samples_per_second": 15.975,
+ "eval_steps_per_second": 1.998,
+ "step": 2560
+ },
+ {
+ "entropy": 0.15343588953837753,
+ "epoch": 6.418430884184309,
+ "grad_norm": 0.4823743402957916,
+ "learning_rate": 7.759885118077701e-05,
+ "loss": 0.09000591039657593,
+ "mean_token_accuracy": 0.9699928767979145,
+ "num_tokens": 6025380.0,
+ "step": 2580
+ },
+ {
+ "epoch": 6.418430884184309,
+ "eval_entropy": 0.2795634938533916,
+ "eval_loss": 0.7647850513458252,
+ "eval_mean_token_accuracy": 0.8503464397995971,
+ "eval_num_tokens": 6025380.0,
+ "eval_runtime": 85.8886,
+ "eval_samples_per_second": 16.009,
+ "eval_steps_per_second": 2.003,
+ "step": 2580
+ },
+ {
+ "entropy": 0.15740026142448188,
+ "epoch": 6.468244084682441,
+ "grad_norm": 0.5082696676254272,
+ "learning_rate": 7.57389294347494e-05,
+ "loss": 0.09191849827766418,
+ "mean_token_accuracy": 0.9692809768021107,
+ "num_tokens": 6073349.0,
+ "step": 2600
+ },
+ {
+ "epoch": 6.468244084682441,
+ "eval_entropy": 0.2913342311458532,
+ "eval_loss": 0.7518694996833801,
+ "eval_mean_token_accuracy": 0.8483168302580367,
+ "eval_num_tokens": 6073349.0,
+ "eval_runtime": 85.5761,
+ "eval_samples_per_second": 16.068,
+ "eval_steps_per_second": 2.01,
+ "step": 2600
+ },
+ {
+ "entropy": 0.15922069251537324,
+ "epoch": 6.518057285180573,
+ "grad_norm": 0.3995199501514435,
+ "learning_rate": 7.389028725958736e-05,
+ "loss": 0.09584367871284485,
+ "mean_token_accuracy": 0.9685114495456218,
+ "num_tokens": 6118148.0,
+ "step": 2620
+ },
+ {
+ "epoch": 6.518057285180573,
+ "eval_entropy": 0.2863075934177221,
+ "eval_loss": 0.7539381384849548,
+ "eval_mean_token_accuracy": 0.8507507083027862,
+ "eval_num_tokens": 6118148.0,
+ "eval_runtime": 86.112,
+ "eval_samples_per_second": 15.968,
+ "eval_steps_per_second": 1.997,
+ "step": 2620
+ },
+ {
+ "entropy": 0.16197575423866512,
+ "epoch": 6.567870485678705,
+ "grad_norm": 0.534295380115509,
+ "learning_rate": 7.205348218055678e-05,
+ "loss": 0.0961170256137848,
+ "mean_token_accuracy": 0.9674530044198036,
+ "num_tokens": 6165523.0,
+ "step": 2640
+ },
+ {
+ "epoch": 6.567870485678705,
+ "eval_entropy": 0.29021967315050057,
+ "eval_loss": 0.751198947429657,
+ "eval_mean_token_accuracy": 0.8509796344956686,
+ "eval_num_tokens": 6165523.0,
+ "eval_runtime": 85.7958,
+ "eval_samples_per_second": 16.026,
+ "eval_steps_per_second": 2.005,
+ "step": 2640
+ },
+ {
+ "entropy": 0.15261746793985367,
+ "epoch": 6.617683686176837,
+ "grad_norm": 0.5391237139701843,
+ "learning_rate": 7.022906815301673e-05,
+ "loss": 0.0926026999950409,
+ "mean_token_accuracy": 0.9695659473538398,
+ "num_tokens": 6216232.0,
+ "step": 2660
+ },
+ {
+ "epoch": 6.617683686176837,
+ "eval_entropy": 0.29128045216202736,
+ "eval_loss": 0.7450292110443115,
+ "eval_mean_token_accuracy": 0.8498771443616512,
+ "eval_num_tokens": 6216232.0,
+ "eval_runtime": 86.3963,
+ "eval_samples_per_second": 15.915,
+ "eval_steps_per_second": 1.991,
+ "step": 2660
+ },
+ {
+ "entropy": 0.16164180357009172,
+ "epoch": 6.667496886674969,
+ "grad_norm": 0.5767946243286133,
+ "learning_rate": 6.841759539535419e-05,
+ "loss": 0.09291981458663941,
+ "mean_token_accuracy": 0.9687136687338352,
+ "num_tokens": 6264807.0,
+ "step": 2680
+ },
+ {
+ "epoch": 6.667496886674969,
+ "eval_entropy": 0.2897637223088464,
+ "eval_loss": 0.7503410577774048,
+ "eval_mean_token_accuracy": 0.8503315164599308,
+ "eval_num_tokens": 6264807.0,
+ "eval_runtime": 86.0653,
+ "eval_samples_per_second": 15.976,
+ "eval_steps_per_second": 1.998,
+ "step": 2680
+ },
+ {
+ "entropy": 0.17062523355707526,
+ "epoch": 6.717310087173101,
+ "grad_norm": 0.4974168539047241,
+ "learning_rate": 6.661961022304563e-05,
+ "loss": 0.09713236689567566,
+ "mean_token_accuracy": 0.9661971725523472,
+ "num_tokens": 6308819.0,
+ "step": 2700
+ },
+ {
+ "epoch": 6.717310087173101,
+ "eval_entropy": 0.2765843396963075,
+ "eval_loss": 0.7604002356529236,
+ "eval_mean_token_accuracy": 0.8521115277395692,
+ "eval_num_tokens": 6308819.0,
+ "eval_runtime": 86.1676,
+ "eval_samples_per_second": 15.957,
+ "eval_steps_per_second": 1.996,
+ "step": 2700
+ },
+ {
+ "entropy": 0.17544092936441302,
+ "epoch": 6.767123287671232,
+ "grad_norm": 0.5523537993431091,
+ "learning_rate": 6.483565488389582e-05,
+ "loss": 0.09709116220474243,
+ "mean_token_accuracy": 0.9650957375764847,
+ "num_tokens": 6352548.0,
+ "step": 2720
+ },
+ {
+ "epoch": 6.767123287671232,
+ "eval_entropy": 0.27939334659035814,
+ "eval_loss": 0.7534670829772949,
+ "eval_mean_token_accuracy": 0.851230604010959,
+ "eval_num_tokens": 6352548.0,
+ "eval_runtime": 86.2913,
+ "eval_samples_per_second": 15.934,
+ "eval_steps_per_second": 1.993,
+ "step": 2720
+ },
+ {
+ "entropy": 0.15991022661328316,
+ "epoch": 6.816936488169365,
+ "grad_norm": 0.478551983833313,
+ "learning_rate": 6.306626739450311e-05,
+ "loss": 0.09564646482467651,
+ "mean_token_accuracy": 0.9679084822535515,
+ "num_tokens": 6397720.0,
+ "step": 2740
+ },
+ {
+ "epoch": 6.816936488169365,
+ "eval_entropy": 0.27878295491601146,
+ "eval_loss": 0.7519959211349487,
+ "eval_mean_token_accuracy": 0.8510654949864676,
+ "eval_num_tokens": 6397720.0,
+ "eval_runtime": 85.9109,
+ "eval_samples_per_second": 16.005,
+ "eval_steps_per_second": 2.002,
+ "step": 2740
+ },
+ {
+ "entropy": 0.16824879590421915,
+ "epoch": 6.866749688667497,
+ "grad_norm": 0.6681098937988281,
+ "learning_rate": 6.131198137800108e-05,
+ "loss": 0.0962279736995697,
+ "mean_token_accuracy": 0.966830012947321,
+ "num_tokens": 6442821.0,
+ "step": 2760
+ },
+ {
+ "epoch": 6.866749688667497,
+ "eval_entropy": 0.2834690434121808,
+ "eval_loss": 0.751922070980072,
+ "eval_mean_token_accuracy": 0.8521237577809844,
+ "eval_num_tokens": 6442821.0,
+ "eval_runtime": 86.3618,
+ "eval_samples_per_second": 15.921,
+ "eval_steps_per_second": 1.992,
+ "step": 2760
+ },
+ {
+ "entropy": 0.1518704930320382,
+ "epoch": 6.916562889165629,
+ "grad_norm": 0.5201290249824524,
+ "learning_rate": 5.957332590312513e-05,
+ "loss": 0.09010660648345947,
+ "mean_token_accuracy": 0.9693463340401649,
+ "num_tokens": 6494118.0,
+ "step": 2780
+ },
+ {
+ "epoch": 6.916562889165629,
+ "eval_entropy": 0.28485129617674404,
+ "eval_loss": 0.7452457547187805,
+ "eval_mean_token_accuracy": 0.8512036796919135,
+ "eval_num_tokens": 6494118.0,
+ "eval_runtime": 86.4524,
+ "eval_samples_per_second": 15.905,
+ "eval_steps_per_second": 1.99,
+ "step": 2780
+ },
+ {
+ "entropy": 0.15512610590085388,
+ "epoch": 6.966376089663761,
+ "grad_norm": 0.42802050709724426,
+ "learning_rate": 5.785082532465233e-05,
+ "loss": 0.09320432543754578,
+ "mean_token_accuracy": 0.9686134628951549,
+ "num_tokens": 6540175.0,
+ "step": 2800
+ },
+ {
+ "epoch": 6.966376089663761,
+ "eval_entropy": 0.27554594526110693,
+ "eval_loss": 0.7644653916358948,
+ "eval_mean_token_accuracy": 0.8513738523389018,
+ "eval_num_tokens": 6540175.0,
+ "eval_runtime": 85.7609,
+ "eval_samples_per_second": 16.033,
+ "eval_steps_per_second": 2.006,
+ "step": 2800
+ },
+ {
+ "entropy": 0.17524497526196334,
+ "epoch": 7.01494396014944,
+ "grad_norm": 0.3330269157886505,
+ "learning_rate": 5.6144999125263545e-05,
+ "loss": 0.0895616888999939,
+ "mean_token_accuracy": 0.9682766932707566,
+ "num_tokens": 6583767.0,
+ "step": 2820
+ },
+ {
+ "epoch": 7.01494396014944,
+ "eval_entropy": 0.2735865569218647,
+ "eval_loss": 0.768479585647583,
+ "eval_mean_token_accuracy": 0.8503459383581959,
+ "eval_num_tokens": 6583767.0,
+ "eval_runtime": 85.7162,
+ "eval_samples_per_second": 16.041,
+ "eval_steps_per_second": 2.007,
+ "step": 2820
+ },
+ {
+ "entropy": 0.1403565663844347,
+ "epoch": 7.064757160647572,
+ "grad_norm": 0.35613498091697693,
+ "learning_rate": 5.4456361758874235e-05,
+ "loss": 0.07551313638687134,
+ "mean_token_accuracy": 0.9739301167428493,
+ "num_tokens": 6627672.0,
+ "step": 2840
+ },
+ {
+ "epoch": 7.064757160647572,
+ "eval_entropy": 0.25941789089593775,
+ "eval_loss": 0.8209511637687683,
+ "eval_mean_token_accuracy": 0.8505055855873019,
+ "eval_num_tokens": 6627672.0,
+ "eval_runtime": 86.0943,
+ "eval_samples_per_second": 15.971,
+ "eval_steps_per_second": 1.998,
+ "step": 2840
+ },
+ {
+ "entropy": 0.13500106502324344,
+ "epoch": 7.114570361145703,
+ "grad_norm": 0.34418627619743347,
+ "learning_rate": 5.2785422495482234e-05,
+ "loss": 0.07293946146965027,
+ "mean_token_accuracy": 0.9747208289802074,
+ "num_tokens": 6672946.0,
+ "step": 2860
+ },
+ {
+ "epoch": 7.114570361145703,
+ "eval_entropy": 0.26482899772912954,
+ "eval_loss": 0.798904538154602,
+ "eval_mean_token_accuracy": 0.8511530233677044,
+ "eval_num_tokens": 6672946.0,
+ "eval_runtime": 85.7915,
+ "eval_samples_per_second": 16.027,
+ "eval_steps_per_second": 2.005,
+ "step": 2860
+ },
+ {
+ "entropy": 0.13127502552233636,
+ "epoch": 7.164383561643835,
+ "grad_norm": 0.4638441503047943,
+ "learning_rate": 5.113268526757892e-05,
+ "loss": 0.07121461629867554,
+ "mean_token_accuracy": 0.9756786689162255,
+ "num_tokens": 6718582.0,
+ "step": 2880
+ },
+ {
+ "epoch": 7.164383561643835,
+ "eval_entropy": 0.2645381211714689,
+ "eval_loss": 0.809101939201355,
+ "eval_mean_token_accuracy": 0.8514727898115335,
+ "eval_num_tokens": 6718582.0,
+ "eval_runtime": 85.84,
+ "eval_samples_per_second": 16.018,
+ "eval_steps_per_second": 2.004,
+ "step": 2880
+ },
+ {
+ "entropy": 0.1331390908919275,
+ "epoch": 7.214196762141968,
+ "grad_norm": 0.40206775069236755,
+ "learning_rate": 4.949864851817007e-05,
+ "loss": 0.07188264131546021,
+ "mean_token_accuracy": 0.9755406074225903,
+ "num_tokens": 6764387.0,
+ "step": 2900
+ },
+ {
+ "epoch": 7.214196762141968,
+ "eval_entropy": 0.26244733283339544,
+ "eval_loss": 0.8143188953399658,
+ "eval_mean_token_accuracy": 0.8514358189909957,
+ "eval_num_tokens": 6764387.0,
+ "eval_runtime": 85.8546,
+ "eval_samples_per_second": 16.015,
+ "eval_steps_per_second": 2.003,
+ "step": 2900
+ },
+ {
+ "entropy": 0.13647331558167936,
+ "epoch": 7.2640099626401,
+ "grad_norm": 0.26405787467956543,
+ "learning_rate": 4.788380505045224e-05,
+ "loss": 0.07412450313568116,
+ "mean_token_accuracy": 0.9744274213910102,
+ "num_tokens": 6809678.0,
+ "step": 2920
+ },
+ {
+ "epoch": 7.2640099626401,
+ "eval_entropy": 0.2626111418182074,
+ "eval_loss": 0.8111525177955627,
+ "eval_mean_token_accuracy": 0.8512121695418691,
+ "eval_num_tokens": 6809678.0,
+ "eval_runtime": 85.9626,
+ "eval_samples_per_second": 15.995,
+ "eval_steps_per_second": 2.001,
+ "step": 2920
+ },
+ {
+ "entropy": 0.12644002586603165,
+ "epoch": 7.313823163138232,
+ "grad_norm": 0.27514681220054626,
+ "learning_rate": 4.6288641879189884e-05,
+ "loss": 0.06807711124420165,
+ "mean_token_accuracy": 0.9760703906416893,
+ "num_tokens": 6860750.0,
+ "step": 2940
+ },
+ {
+ "epoch": 7.313823163138232,
+ "eval_entropy": 0.26096762734097106,
+ "eval_loss": 0.8184595108032227,
+ "eval_mean_token_accuracy": 0.8501476153384807,
+ "eval_num_tokens": 6860750.0,
+ "eval_runtime": 85.9521,
+ "eval_samples_per_second": 15.997,
+ "eval_steps_per_second": 2.001,
+ "step": 2940
+ },
+ {
+ "entropy": 0.13920630998909472,
+ "epoch": 7.363636363636363,
+ "grad_norm": 0.23584705591201782,
+ "learning_rate": 4.4713640083838604e-05,
+ "loss": 0.07301607131958007,
+ "mean_token_accuracy": 0.9745715200901032,
+ "num_tokens": 6907092.0,
+ "step": 2960
+ },
+ {
+ "epoch": 7.363636363636363,
+ "eval_entropy": 0.2612536767021168,
+ "eval_loss": 0.8116245269775391,
+ "eval_mean_token_accuracy": 0.8510967350976412,
+ "eval_num_tokens": 6907092.0,
+ "eval_runtime": 85.6373,
+ "eval_samples_per_second": 16.056,
+ "eval_steps_per_second": 2.008,
+ "step": 2960
+ },
+ {
+ "entropy": 0.1349492883309722,
+ "epoch": 7.4134495641344955,
+ "grad_norm": 0.24552719295024872,
+ "learning_rate": 4.315927466345791e-05,
+ "loss": 0.07397544980049134,
+ "mean_token_accuracy": 0.9745095103979111,
+ "num_tokens": 6952700.0,
+ "step": 2980
+ },
+ {
+ "epoch": 7.4134495641344955,
+ "eval_entropy": 0.25796533306670744,
+ "eval_loss": 0.8266491293907166,
+ "eval_mean_token_accuracy": 0.8511653857868772,
+ "eval_num_tokens": 6952700.0,
+ "eval_runtime": 85.7462,
+ "eval_samples_per_second": 16.036,
+ "eval_steps_per_second": 2.006,
+ "step": 2980
+ },
+ {
+ "entropy": 0.14479175000451505,
+ "epoch": 7.463262764632628,
+ "grad_norm": 0.2846072018146515,
+ "learning_rate": 4.162601439345814e-05,
+ "loss": 0.07544798254966736,
+ "mean_token_accuracy": 0.9727819666266442,
+ "num_tokens": 6996430.0,
+ "step": 3000
+ },
+ {
+ "epoch": 7.463262764632628,
+ "eval_entropy": 0.2584348309698493,
+ "eval_loss": 0.8253348469734192,
+ "eval_mean_token_accuracy": 0.8511569815319638,
+ "eval_num_tokens": 6996430.0,
+ "eval_runtime": 86.2984,
+ "eval_samples_per_second": 15.933,
+ "eval_steps_per_second": 1.993,
+ "step": 3000
+ },
+ {
+ "entropy": 0.14114196319133043,
+ "epoch": 7.51307596513076,
+ "grad_norm": 0.407966285943985,
+ "learning_rate": 4.011432168422419e-05,
+ "loss": 0.0736398994922638,
+ "mean_token_accuracy": 0.9741654269397259,
+ "num_tokens": 7042038.0,
+ "step": 3020
+ },
+ {
+ "epoch": 7.51307596513076,
+ "eval_entropy": 0.25232676260693127,
+ "eval_loss": 0.8296052813529968,
+ "eval_mean_token_accuracy": 0.8523298349491385,
+ "eval_num_tokens": 7042038.0,
+ "eval_runtime": 85.8445,
+ "eval_samples_per_second": 16.017,
+ "eval_steps_per_second": 2.004,
+ "step": 3020
+ },
+ {
+ "entropy": 0.1353456223383546,
+ "epoch": 7.562889165628892,
+ "grad_norm": 0.2712634801864624,
+ "learning_rate": 3.8624652441658684e-05,
+ "loss": 0.07362412214279175,
+ "mean_token_accuracy": 0.9747945807874203,
+ "num_tokens": 7089390.0,
+ "step": 3040
+ },
+ {
+ "epoch": 7.562889165628892,
+ "eval_entropy": 0.2579477243991785,
+ "eval_loss": 0.8274564743041992,
+ "eval_mean_token_accuracy": 0.8517705212498821,
+ "eval_num_tokens": 7089390.0,
+ "eval_runtime": 85.8222,
+ "eval_samples_per_second": 16.022,
+ "eval_steps_per_second": 2.004,
+ "step": 3040
+ },
+ {
+ "entropy": 0.1296080862637609,
+ "epoch": 7.6127023661270234,
+ "grad_norm": 0.2371893972158432,
+ "learning_rate": 3.715745592968707e-05,
+ "loss": 0.06971035599708557,
+ "mean_token_accuracy": 0.9759043246507645,
+ "num_tokens": 7138002.0,
+ "step": 3060
+ },
+ {
+ "epoch": 7.6127023661270234,
+ "eval_entropy": 0.25391967083479083,
+ "eval_loss": 0.8197130560874939,
+ "eval_mean_token_accuracy": 0.8522267875283264,
+ "eval_num_tokens": 7138002.0,
+ "eval_runtime": 85.8796,
+ "eval_samples_per_second": 16.011,
+ "eval_steps_per_second": 2.003,
+ "step": 3060
+ },
+ {
+ "entropy": 0.1311203008517623,
+ "epoch": 7.662515566625156,
+ "grad_norm": 0.22499267756938934,
+ "learning_rate": 3.5713174634765967e-05,
+ "loss": 0.07176244258880615,
+ "mean_token_accuracy": 0.9754939571022987,
+ "num_tokens": 7185520.0,
+ "step": 3080
+ },
+ {
+ "epoch": 7.662515566625156,
+ "eval_entropy": 0.2526215241225653,
+ "eval_loss": 0.8265154361724854,
+ "eval_mean_token_accuracy": 0.8519952584837758,
+ "eval_num_tokens": 7185520.0,
+ "eval_runtime": 85.8746,
+ "eval_samples_per_second": 16.012,
+ "eval_steps_per_second": 2.003,
+ "step": 3080
+ },
+ {
+ "entropy": 0.13420484317466616,
+ "epoch": 7.712328767123288,
+ "grad_norm": 0.2398064285516739,
+ "learning_rate": 3.4292244132434866e-05,
+ "loss": 0.07559212446212768,
+ "mean_token_accuracy": 0.9743142127990723,
+ "num_tokens": 7232170.0,
+ "step": 3100
+ },
+ {
+ "epoch": 7.712328767123288,
+ "eval_entropy": 0.2484562756537005,
+ "eval_loss": 0.8312150239944458,
+ "eval_mean_token_accuracy": 0.8528405119513356,
+ "eval_num_tokens": 7232170.0,
+ "eval_runtime": 85.7896,
+ "eval_samples_per_second": 16.028,
+ "eval_steps_per_second": 2.005,
+ "step": 3100
+ }
+ ],
+ "logging_steps": 20,
+ "max_steps": 4020,
+ "num_input_tokens_seen": 0,
+ "num_train_epochs": 10,
+ "save_steps": 20,
+ "stateful_callbacks": {
+ "TrainerControl": {
+ "args": {
+ "should_epoch_stop": false,
+ "should_evaluate": false,
+ "should_log": false,
+ "should_save": true,
+ "should_training_stop": false
+ },
+ "attributes": {}
+ }
+ },
+ "total_flos": 3.05284825399253e+17,
+ "train_batch_size": 4,
+ "trial_name": null,
+ "trial_params": null
+}
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3120/README.md b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3120/README.md
new file mode 100644
index 0000000000000000000000000000000000000000..41e6c854e77830e9ea767c8c35f8c82a65c1ba35
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3120/README.md
@@ -0,0 +1,209 @@
+---
+base_model: Qwen/Qwen3.5-4B-Base
+library_name: peft
+pipeline_tag: text-generation
+tags:
+- base_model:adapter:Qwen/Qwen3.5-4B-Base
+- lora
+- sft
+- transformers
+- trl
+---
+
+# Model Card for Model ID
+
+
+
+
+
+## Model Details
+
+### Model Description
+
+
+
+
+
+- **Developed by:** [More Information Needed]
+- **Funded by [optional]:** [More Information Needed]
+- **Shared by [optional]:** [More Information Needed]
+- **Model type:** [More Information Needed]
+- **Language(s) (NLP):** [More Information Needed]
+- **License:** [More Information Needed]
+- **Finetuned from model [optional]:** [More Information Needed]
+
+### Model Sources [optional]
+
+
+
+- **Repository:** [More Information Needed]
+- **Paper [optional]:** [More Information Needed]
+- **Demo [optional]:** [More Information Needed]
+
+## Uses
+
+
+
+### Direct Use
+
+
+
+[More Information Needed]
+
+### Downstream Use [optional]
+
+
+
+[More Information Needed]
+
+### Out-of-Scope Use
+
+
+
+[More Information Needed]
+
+## Bias, Risks, and Limitations
+
+
+
+[More Information Needed]
+
+### Recommendations
+
+
+
+Users (both direct and downstream) should be made aware of the risks, biases and limitations of the model. More information needed for further recommendations.
+
+## How to Get Started with the Model
+
+Use the code below to get started with the model.
+
+[More Information Needed]
+
+## Training Details
+
+### Training Data
+
+
+
+[More Information Needed]
+
+### Training Procedure
+
+
+
+#### Preprocessing [optional]
+
+[More Information Needed]
+
+
+#### Training Hyperparameters
+
+- **Training regime:** [More Information Needed]
+
+#### Speeds, Sizes, Times [optional]
+
+
+
+[More Information Needed]
+
+## Evaluation
+
+
+
+### Testing Data, Factors & Metrics
+
+#### Testing Data
+
+
+
+[More Information Needed]
+
+#### Factors
+
+
+
+[More Information Needed]
+
+#### Metrics
+
+
+
+[More Information Needed]
+
+### Results
+
+[More Information Needed]
+
+#### Summary
+
+
+
+## Model Examination [optional]
+
+
+
+[More Information Needed]
+
+## Environmental Impact
+
+
+
+Carbon emissions can be estimated using the [Machine Learning Impact calculator](https://mlco2.github.io/impact#compute) presented in [Lacoste et al. (2019)](https://arxiv.org/abs/1910.09700).
+
+- **Hardware Type:** [More Information Needed]
+- **Hours used:** [More Information Needed]
+- **Cloud Provider:** [More Information Needed]
+- **Compute Region:** [More Information Needed]
+- **Carbon Emitted:** [More Information Needed]
+
+## Technical Specifications [optional]
+
+### Model Architecture and Objective
+
+[More Information Needed]
+
+### Compute Infrastructure
+
+[More Information Needed]
+
+#### Hardware
+
+[More Information Needed]
+
+#### Software
+
+[More Information Needed]
+
+## Citation [optional]
+
+
+
+**BibTeX:**
+
+[More Information Needed]
+
+**APA:**
+
+[More Information Needed]
+
+## Glossary [optional]
+
+
+
+[More Information Needed]
+
+## More Information [optional]
+
+[More Information Needed]
+
+## Model Card Authors [optional]
+
+[More Information Needed]
+
+## Model Card Contact
+
+[More Information Needed]
+### Framework versions
+
+- PEFT 0.18.1
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3120/adapter_config.json b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3120/adapter_config.json
new file mode 100644
index 0000000000000000000000000000000000000000..4e1911440bbdf4e34c1f99d492253e23cdedc8b2
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3120/adapter_config.json
@@ -0,0 +1,46 @@
+{
+ "alora_invocation_tokens": null,
+ "alpha_pattern": {},
+ "arrow_config": null,
+ "auto_mapping": null,
+ "base_model_name_or_path": "Qwen/Qwen3.5-4B-Base",
+ "bias": "none",
+ "corda_config": null,
+ "ensure_weight_tying": false,
+ "eva_config": null,
+ "exclude_modules": null,
+ "fan_in_fan_out": false,
+ "inference_mode": true,
+ "init_lora_weights": true,
+ "layer_replication": null,
+ "layers_pattern": null,
+ "layers_to_transform": null,
+ "loftq_config": {},
+ "lora_alpha": 256,
+ "lora_bias": false,
+ "lora_dropout": 0.028265386974777595,
+ "megatron_config": null,
+ "megatron_core": "megatron.core",
+ "modules_to_save": null,
+ "peft_type": "LORA",
+ "peft_version": "0.18.1",
+ "qalora_group_size": 16,
+ "r": 128,
+ "rank_pattern": {},
+ "revision": null,
+ "target_modules": [
+ "up_proj",
+ "q_proj",
+ "o_proj",
+ "v_proj",
+ "k_proj",
+ "gate_proj",
+ "down_proj"
+ ],
+ "target_parameters": null,
+ "task_type": "CAUSAL_LM",
+ "trainable_token_indices": null,
+ "use_dora": false,
+ "use_qalora": false,
+ "use_rslora": false
+}
\ No newline at end of file
diff --git a/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3120/chat_template.jinja b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3120/chat_template.jinja
new file mode 100644
index 0000000000000000000000000000000000000000..a585dec894e63da457d9440ec6aa7caa16d20860
--- /dev/null
+++ b/overgeneralisation_original_Swedish/Qwen3.5-4B-Base_overgeneralisation_splits_original_features_train_overgeneralisation_splits_original_features_test2/checkpoint-3120/chat_template.jinja
@@ -0,0 +1,154 @@
+{%- set image_count = namespace(value=0) %}
+{%- set video_count = namespace(value=0) %}
+{%- macro render_content(content, do_vision_count, is_system_content=false) %}
+ {%- if content is string %}
+ {{- content }}
+ {%- elif content is iterable and content is not mapping %}
+ {%- for item in content %}
+ {%- if 'image' in item or 'image_url' in item or item.type == 'image' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain images.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set image_count.value = image_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Picture ' ~ image_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|image_pad|><|vision_end|>' }}
+ {%- elif 'video' in item or item.type == 'video' %}
+ {%- if is_system_content %}
+ {{- raise_exception('System message cannot contain videos.') }}
+ {%- endif %}
+ {%- if do_vision_count %}
+ {%- set video_count.value = video_count.value + 1 %}
+ {%- endif %}
+ {%- if add_vision_id %}
+ {{- 'Video ' ~ video_count.value ~ ': ' }}
+ {%- endif %}
+ {{- '<|vision_start|><|video_pad|><|vision_end|>' }}
+ {%- elif 'text' in item %}
+ {{- item.text }}
+ {%- else %}
+ {{- raise_exception('Unexpected item type in content.') }}
+ {%- endif %}
+ {%- endfor %}
+ {%- elif content is none or content is undefined %}
+ {{- '' }}
+ {%- else %}
+ {{- raise_exception('Unexpected content type.') }}
+ {%- endif %}
+{%- endmacro %}
+{%- if not messages %}
+ {{- raise_exception('No messages provided.') }}
+{%- endif %}
+{%- if tools and tools is iterable and tools is not mapping %}
+ {{- '<|im_start|>system\n' }}
+ {{- "# Tools\n\nYou have access to the following functions:\n\n" }}
+ {%- for tool in tools %}
+ {{- "\n" }}
+ {{- tool | tojson }}
+ {%- endfor %}
+ {{- "\n" }}
+ {{- '\n\nIf you choose to call a function ONLY reply in the following format with NO suffix:\n\n\n\n\nvalue_1\n\n\nThis is the value for the second parameter\nthat can span\nmultiple lines\n\n\n\n\n\nReminder:\n- Function calls MUST follow the specified format: an inner block must be nested within XML tags\n- Required parameters MUST be specified\n- You may provide optional reasoning for your function call in natural language BEFORE the function call, but NOT after\n- If there is no function call available, answer the question like normal with your current knowledge and do not tell the user about function calls\n' }}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {%- if content %}
+ {{- '\n\n' + content }}
+ {%- endif %}
+ {%- endif %}
+ {{- '<|im_end|>\n' }}
+{%- else %}
+ {%- if messages[0].role == 'system' %}
+ {%- set content = render_content(messages[0].content, false, true)|trim %}
+ {{- '<|im_start|>system\n' + content + '<|im_end|>\n' }}
+ {%- endif %}
+{%- endif %}
+{%- set ns = namespace(multi_step_tool=true, last_query_index=messages|length - 1) %}
+{%- for message in messages[::-1] %}
+ {%- set index = (messages|length - 1) - loop.index0 %}
+ {%- if ns.multi_step_tool and message.role == "user" %}
+ {%- set content = render_content(message.content, false)|trim %}
+ {%- if not(content.startswith('') and content.endswith('')) %}
+ {%- set ns.multi_step_tool = false %}
+ {%- set ns.last_query_index = index %}
+ {%- endif %}
+ {%- endif %}
+{%- endfor %}
+{%- if ns.multi_step_tool %}
+ {{- raise_exception('No user query found in messages.') }}
+{%- endif %}
+{%- for message in messages %}
+ {%- set content = render_content(message.content, true)|trim %}
+ {%- if message.role == "system" %}
+ {%- if not loop.first %}
+ {{- raise_exception('System message must be at the beginning.') }}
+ {%- endif %}
+ {%- elif message.role == "user" %}
+ {{- '<|im_start|>' + message.role + '\n' + content + '<|im_end|>' + '\n' }}
+ {%- elif message.role == "assistant" %}
+ {%- set reasoning_content = '' %}
+ {%- if message.reasoning_content is string %}
+ {%- set reasoning_content = message.reasoning_content %}
+ {%- else %}
+ {%- if '' in content %}
+ {%- set reasoning_content = content.split('')[0].rstrip('\n').split('')[-1].lstrip('\n') %}
+ {%- set content = content.split('')[-1].lstrip('\n') %}
+ {%- endif %}
+ {%- endif %}
+ {%- set reasoning_content = reasoning_content|trim %}
+ {%- if loop.index0 > ns.last_query_index %}
+ {{- '<|im_start|>' + message.role + '\n\n' + reasoning_content + '\n\n\n' + content }}
+ {%- else %}
+ {{- '<|im_start|>' + message.role + '\n' + content }}
+ {%- endif %}
+ {%- if message.tool_calls and message.tool_calls is iterable and message.tool_calls is not mapping %}
+ {%- for tool_call in message.tool_calls %}
+ {%- if tool_call.function is defined %}
+ {%- set tool_call = tool_call.function %}
+ {%- endif %}
+ {%- if loop.first %}
+ {%- if content|trim %}
+ {{- '\n\n\n\n' }}
+ {%- else %}
+ {{- '\n\n' }}
+ {%- endif %}
+ {%- else %}
+ {{- '\n\n\n' }}
+ {%- endif %}
+ {%- if tool_call.arguments is defined %}
+ {%- for args_name, args_value in tool_call.arguments|items %}
+ {{- '